GLM-5.3-Flash: Z.ai abre código de modelo 10x más eficiente

GLM-5.3-Flash: Z.ai abre código de modelo 10x más eficiente

⏱ Tiempo de lectura: 3 min

Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje de código abierto que es 10 veces más eficiente en costos que su predecesor. El modelo, originalmente lanzado bajo el nombre en clave Ox Alpha a través de OpenRouter, cuenta con 320 mil millones de parámetros y activa 18 mil millones para procesar consultas. Soporta contextos de hasta 1 millón de tokens y respuestas de hasta 131,072 tokens.

Arquitectura optimizada y mejoras de rendimiento

GLM-5.3-Flash introduce cambios significativos en su mecanismo de atención, componente clave que analiza consultas de usuarios. Z.ai implementó atención dispersa, que revisa únicamente los tokens más relevantes en lugar de procesar cada uno, reduciendo carga computacional. También incorporó atención lineal, que sustituye la función softmax por un algoritmo más eficiente, limitando el uso de memoria RAM al duplicarse el tamaño de la consulta, en lugar de cuadriplicarse. Estos avances posicionan al modelo entre los más optimizados en su clase.

Benchmarks y disponibilidad

GLM-5.3-Flash obtuvo la puntuación más alta en GDPval-AA v2, evaluación que mide capacidades de trabajo de conocimiento, y quedó segundo en AutomationBench, prueba que evalúa aptitud para completar tareas en aplicaciones en la nube. Fue entrenado con 30 billones de tokens usando tecnología mHC para optimizar gradientes durante el aprendizaje. Los pesos del modelo están disponibles en Hugging Face. La fuente completa del anuncio está en siliconangle.com.

Característica Detalle
Nombre del modelo GLM-5.3-Flash (anteriormente Ox Alpha)
Parámetros totales 320 mil millones
Parámetros activos 18 mil millones
Contexto máximo 1 millón de tokens (texto, imágenes y video)
Respuestas máximas 131,072 tokens
Tecnología de atención Atención dispersa y atención lineal
Tokens de entrenamiento 30 billones
Benchmark GDPval-AA v2 Puntuación más alta
Benchmark AutomationBench Segundo lugar
Disponibilidad Código abierto en Hugging Face
Eficiencia de costos 10 veces menor que generación anterior

Preguntas frecuentes sobre GLM-5.3-Flash

¿Cuál es la diferencia entre GLM-5.3-Flash y Ox Alpha?

GLM-5.3-Flash es el nombre oficial del modelo que Z.ai lanzó bajo el codename Ox Alpha a través de OpenRouter. Son la misma arquitectura y versión.

¿Cuándo se lanzó GLM-5.3-Flash?

El modelo se lanzó públicamente en la semana anterior a la del anuncio oficial (semana del 26 de agosto de 2026). Los pesos de código abierto están disponibles inmediatamente en Hugging Face.

¿Cómo acceder al modelo?

GLM-5.3-Flash está disponible como código abierto en Hugging Face, permitiendo integración en aplicaciones y servicios propios. También fue hospedado en OpenRouter antes de la confirmación oficial de Z.ai.

Impacto en el ecosistema de modelos abiertos

La liberación de GLM-5.3-Flash con reducción de costos del 90% amplia opciones para desarrolladores independientes y empresas que buscan modelos eficientes. Competidores directos como Claude Opus, GPT-5.6 Terra y Gemini 3.7 Flash mantienen diferentes propuestas, pero GLM-5.3-Flash destaca en automatización de tareas específicas. La arquitectura de atención lineal de Z.ai sienta precedente técnico replicable en futuros modelos.

En Inteligencia Artificial, la apertura de código en modelos de gran escala acelera innovación descentralizada. ¿Será este patrón de eficiencia la nueva línea de corte competitiva en 2027?

Fuente: siliconangle.com

Deja una respuesta

Subir