GLM-5.3-Flash: Z.ai abre código de modelo 10x más eficiente

⏱ Tiempo de lectura: 3 min
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje de código abierto que es 10 veces más eficiente en costos que su predecesor. El modelo, originalmente lanzado bajo el nombre en clave Ox Alpha a través de OpenRouter, cuenta con 320 mil millones de parámetros y activa 18 mil millones para procesar consultas. Soporta contextos de hasta 1 millón de tokens y respuestas de hasta 131,072 tokens.
Arquitectura optimizada y mejoras de rendimiento
GLM-5.3-Flash introduce cambios significativos en su mecanismo de atención, componente clave que analiza consultas de usuarios. Z.ai implementó atención dispersa, que revisa únicamente los tokens más relevantes en lugar de procesar cada uno, reduciendo carga computacional. También incorporó atención lineal, que sustituye la función softmax por un algoritmo más eficiente, limitando el uso de memoria RAM al duplicarse el tamaño de la consulta, en lugar de cuadriplicarse. Estos avances posicionan al modelo entre los más optimizados en su clase.
Benchmarks y disponibilidad
GLM-5.3-Flash obtuvo la puntuación más alta en GDPval-AA v2, evaluación que mide capacidades de trabajo de conocimiento, y quedó segundo en AutomationBench, prueba que evalúa aptitud para completar tareas en aplicaciones en la nube. Fue entrenado con 30 billones de tokens usando tecnología mHC para optimizar gradientes durante el aprendizaje. Los pesos del modelo están disponibles en Hugging Face. La fuente completa del anuncio está en siliconangle.com.
| Característica | Detalle |
|---|---|
| Nombre del modelo | GLM-5.3-Flash (anteriormente Ox Alpha) |
| Parámetros totales | 320 mil millones |
| Parámetros activos | 18 mil millones |
| Contexto máximo | 1 millón de tokens (texto, imágenes y video) |
| Respuestas máximas | 131,072 tokens |
| Tecnología de atención | Atención dispersa y atención lineal |
| Tokens de entrenamiento | 30 billones |
| Benchmark GDPval-AA v2 | Puntuación más alta |
| Benchmark AutomationBench | Segundo lugar |
| Disponibilidad | Código abierto en Hugging Face |
| Eficiencia de costos | 10 veces menor que generación anterior |
Preguntas frecuentes sobre GLM-5.3-Flash
¿Cuál es la diferencia entre GLM-5.3-Flash y Ox Alpha?
GLM-5.3-Flash es el nombre oficial del modelo que Z.ai lanzó bajo el codename Ox Alpha a través de OpenRouter. Son la misma arquitectura y versión.
¿Cuándo se lanzó GLM-5.3-Flash?
El modelo se lanzó públicamente en la semana anterior a la del anuncio oficial (semana del 26 de agosto de 2026). Los pesos de código abierto están disponibles inmediatamente en Hugging Face.
¿Cómo acceder al modelo?
GLM-5.3-Flash está disponible como código abierto en Hugging Face, permitiendo integración en aplicaciones y servicios propios. También fue hospedado en OpenRouter antes de la confirmación oficial de Z.ai.
Impacto en el ecosistema de modelos abiertos
La liberación de GLM-5.3-Flash con reducción de costos del 90% amplia opciones para desarrolladores independientes y empresas que buscan modelos eficientes. Competidores directos como Claude Opus, GPT-5.6 Terra y Gemini 3.7 Flash mantienen diferentes propuestas, pero GLM-5.3-Flash destaca en automatización de tareas específicas. La arquitectura de atención lineal de Z.ai sienta precedente técnico replicable en futuros modelos.
En Inteligencia Artificial, la apertura de código en modelos de gran escala acelera innovación descentralizada. ¿Será este patrón de eficiencia la nueva línea de corte competitiva en 2027?
Fuente: siliconangle.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.