Startups desafían los transformers: la próxima era de modelos de lenguaje

⏱ Tiempo de lectura: 4 min
Un creciente número de startups busca superar las limitaciones fundamentales de los transformers, la arquitectura que sostiene todos los grandes modelos de lenguaje actuales. Según MIT Technology Review, empresas como Subquadratic, Manifest AI y Liquid AI desarrollan mecanismos alternativos para reducir costos computacionales, mejorar la eficiencia energética y permitir que los modelos procesen cantidades mucho mayores de datos sin sacrificar rendimiento.
Por qué los transformers se quedan atrás
Desde 2017, cuando Google presentó el paper «Attention Is All You Need», los transformers han sido el motor de cada modelo de lenguaje importante del mercado. Sin embargo, su mecanismo de atención densa — que compara cada palabra con todas las demás — genera un crecimiento exponencial de cálculos conforme aumenta la longitud del texto. Un documento de 10.000 palabras requiere 50 millones de multiplicaciones. Este es el principal motivo por el que los modelos de lenguaje consumen tanta energía. OpenAI planea gastar 50.000 millones de dólares en computación este año, y la Agencia Internacional de Energía predice que el consumo de electricidad de los centros de datos se duplicará para 2030. Además, los transformers luchan por mantener un contexto grande simultáneamente, limitación crítica cuando los modelos necesitan procesar bibliotecas completas de documentos, bases de código enteras o ejecutar tareas de razonamiento que generan notas intermedias.
Cuatro enfoques para redefinir la arquitectura de IA
Subquadratic, con sede en Miami, propone reemplazar la atención densa por atención dispersa que calcula solo en algunos emparejamientos de palabras. La empresa afirma que su modelo SubQ es el primer mecanismo de atención dispersa que rivaliza con los grandes modelos de lenguaje en tareas de búsqueda y codificación, aunque hay escepticismo en la industria. Manifest AI, basada en San Francisco, toma otro camino: desarrolló retención de potencia, un mecanismo que almacena solo la información más relevante y mantiene un resumen dinámico del contexto. Ha adaptado StarCoder a PowerCoder usando esta técnica y lanzó Brumby, que compite con versiones de Qwen de Alibaba. Liquid AI, un spinoff del MIT en Cambridge, integra transformers con redes neurales líquidas para crear modelos de fundación líquida (LFMs). Sus modelos funcionan en Raspberry Pi y han acumulado casi 34 millones de descargas. Alcanzan el rendimiento de modelos cuatro veces más grandes, incluyendo variantes de Qwen y Gemma de Google.
Datos clave del mercado
El MIT Technology Review designó a estos avances como «LLMs+» en su lista de 10 cosas relevantes en inteligencia artificial. Liquid AI ofrece sus modelos gratis para organizaciones con ingresos anuales menores a 10 millones de dólares y ha comprobado que pueden ejecutarse en hardware de bajo costo. El cambio de arquitectura representa una oportunidad significativa: estas startups tienen menos que perder que las grandes corporaciones del sector, mientras que el diseño de los próximos modelos sigue abierto a debate. Ninguno de estos enfoques elimina completamente los transformers, pero todos buscan resolver el cuello de botella que la arquitectura se ha convertido.
| Startup | Enfoque | Producto/Característica |
|---|---|---|
| Subquadratic | Atención dispersa | SubQ: mecanismo de atención dispersa que rivaliza en búsqueda y codificación |
| Manifest AI | Retención de potencia | PowerCoder (adaptación de StarCoder) y Brumby |
| Liquid AI | Redes neurales líquidas + transformers | LFMs: modelos que funcionan en Raspberry Pi, 34 millones de descargas |
| Contexto de costos | Transformación de arquitectura | OpenAI gasta 50.000 millones de dólares en computación en 2026; IEA proyecta duplicación de consumo de energía para 2030 |
Preguntas frecuentes sobre la siguiente generación de modelos de lenguaje
¿Qué problema resuelven estos nuevos enfoques?
Reducen el costo computacional, mejoran la eficiencia energética y permiten que los modelos mantengan contextos más grandes sin perder rendimiento. La atención densa genera millones de operaciones innecesarias; estos métodos las eliminan.
¿Cuándo estarán disponibles para usar?
Subquadratic planea liberar SubQ pronto tras una lista de espera. Manifest AI ya lanzó PowerCoder y Brumby. Liquid AI ofrece sus modelos gratuitamente para organizaciones pequeñas. No hay fechas precisas de adopción masiva en la industria.
¿Significa esto que los transformers desaparecerán?
No. Estos enfoques complementan o mejoran transformers, no los reemplazan por completo. El objetivo es superar sus limitaciones, no eliminarlos.
Nuestra lectura editorial
El cambio de arquitectura lleva años gestándose, pero 2026 marca un punto de inflexión real: el costo energético y computacional de los transformers ya no es sostenible a escala. Estas startups compiten con ventaja: menos bagaje heredado, cultura experimental y presión regulatoria creciente sobre consumo de energía de centros de datos. Las grandes corporaciones dominarán el mercado de producción, pero la próxima generación de modelos será diseñada por quienes entiendan que eficiencia no es lujo, es necesidad.
En Inteligencia Artificial, esto refleja una maduración inevitable: toda tecnología exponencial encuentra su límite termodinámico. La pregunta ahora es quién capitalizará primero la solución arquitectónica correcta.
Fuente: www.technologyreview.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.