Startups desafían los transformers: la próxima era de modelos de lenguaje

Startups desafían los transformers: la próxima era de modelos de lenguaje

⏱ Tiempo de lectura: 4 min

Un creciente número de startups busca superar las limitaciones fundamentales de los transformers, la arquitectura que sostiene todos los grandes modelos de lenguaje actuales. Según MIT Technology Review, empresas como Subquadratic, Manifest AI y Liquid AI desarrollan mecanismos alternativos para reducir costos computacionales, mejorar la eficiencia energética y permitir que los modelos procesen cantidades mucho mayores de datos sin sacrificar rendimiento.

Por qué los transformers se quedan atrás

Desde 2017, cuando Google presentó el paper «Attention Is All You Need», los transformers han sido el motor de cada modelo de lenguaje importante del mercado. Sin embargo, su mecanismo de atención densa — que compara cada palabra con todas las demás — genera un crecimiento exponencial de cálculos conforme aumenta la longitud del texto. Un documento de 10.000 palabras requiere 50 millones de multiplicaciones. Este es el principal motivo por el que los modelos de lenguaje consumen tanta energía. OpenAI planea gastar 50.000 millones de dólares en computación este año, y la Agencia Internacional de Energía predice que el consumo de electricidad de los centros de datos se duplicará para 2030. Además, los transformers luchan por mantener un contexto grande simultáneamente, limitación crítica cuando los modelos necesitan procesar bibliotecas completas de documentos, bases de código enteras o ejecutar tareas de razonamiento que generan notas intermedias.

Cuatro enfoques para redefinir la arquitectura de IA

Subquadratic, con sede en Miami, propone reemplazar la atención densa por atención dispersa que calcula solo en algunos emparejamientos de palabras. La empresa afirma que su modelo SubQ es el primer mecanismo de atención dispersa que rivaliza con los grandes modelos de lenguaje en tareas de búsqueda y codificación, aunque hay escepticismo en la industria. Manifest AI, basada en San Francisco, toma otro camino: desarrolló retención de potencia, un mecanismo que almacena solo la información más relevante y mantiene un resumen dinámico del contexto. Ha adaptado StarCoder a PowerCoder usando esta técnica y lanzó Brumby, que compite con versiones de Qwen de Alibaba. Liquid AI, un spinoff del MIT en Cambridge, integra transformers con redes neurales líquidas para crear modelos de fundación líquida (LFMs). Sus modelos funcionan en Raspberry Pi y han acumulado casi 34 millones de descargas. Alcanzan el rendimiento de modelos cuatro veces más grandes, incluyendo variantes de Qwen y Gemma de Google.

Datos clave del mercado

El MIT Technology Review designó a estos avances como «LLMs+» en su lista de 10 cosas relevantes en inteligencia artificial. Liquid AI ofrece sus modelos gratis para organizaciones con ingresos anuales menores a 10 millones de dólares y ha comprobado que pueden ejecutarse en hardware de bajo costo. El cambio de arquitectura representa una oportunidad significativa: estas startups tienen menos que perder que las grandes corporaciones del sector, mientras que el diseño de los próximos modelos sigue abierto a debate. Ninguno de estos enfoques elimina completamente los transformers, pero todos buscan resolver el cuello de botella que la arquitectura se ha convertido.

Startup Enfoque Producto/Característica
Subquadratic Atención dispersa SubQ: mecanismo de atención dispersa que rivaliza en búsqueda y codificación
Manifest AI Retención de potencia PowerCoder (adaptación de StarCoder) y Brumby
Liquid AI Redes neurales líquidas + transformers LFMs: modelos que funcionan en Raspberry Pi, 34 millones de descargas
Contexto de costos Transformación de arquitectura OpenAI gasta 50.000 millones de dólares en computación en 2026; IEA proyecta duplicación de consumo de energía para 2030

Preguntas frecuentes sobre la siguiente generación de modelos de lenguaje

¿Qué problema resuelven estos nuevos enfoques?

Reducen el costo computacional, mejoran la eficiencia energética y permiten que los modelos mantengan contextos más grandes sin perder rendimiento. La atención densa genera millones de operaciones innecesarias; estos métodos las eliminan.

¿Cuándo estarán disponibles para usar?

Subquadratic planea liberar SubQ pronto tras una lista de espera. Manifest AI ya lanzó PowerCoder y Brumby. Liquid AI ofrece sus modelos gratuitamente para organizaciones pequeñas. No hay fechas precisas de adopción masiva en la industria.

¿Significa esto que los transformers desaparecerán?

No. Estos enfoques complementan o mejoran transformers, no los reemplazan por completo. El objetivo es superar sus limitaciones, no eliminarlos.

Nuestra lectura editorial

El cambio de arquitectura lleva años gestándose, pero 2026 marca un punto de inflexión real: el costo energético y computacional de los transformers ya no es sostenible a escala. Estas startups compiten con ventaja: menos bagaje heredado, cultura experimental y presión regulatoria creciente sobre consumo de energía de centros de datos. Las grandes corporaciones dominarán el mercado de producción, pero la próxima generación de modelos será diseñada por quienes entiendan que eficiencia no es lujo, es necesidad.

En Inteligencia Artificial, esto refleja una maduración inevitable: toda tecnología exponencial encuentra su límite termodinámico. La pregunta ahora es quién capitalizará primero la solución arquitectónica correcta.

Fuente: www.technologyreview.com

Deja una respuesta

Subir