Qwen3.8-Flash-Next: el modelo MoE de Alibaba que adelanta Qwen4

⏱ Tiempo de lectura: 4 min
Alibaba presentó Qwen3.8-Flash-Next, un modelo multimodal de arquitectura Mixture-of-Experts (MoE) de peso abierto que activa solo 6 mil millones de parámetros por token, aunque cuenta con 125 mil millones en su núcleo. La publicación en MarkTechPost detalla que este lanzamiento funciona como vista previa de la arquitectura Qwen4, mostrando avances en eficiencia de entrenamiento y despliegue.
Parámetros, arquitectura y cambios clave de Qwen3.8-Flash-Next
El modelo distribuye sus 125 mil millones de parámetros en una estructura de columna vertebral de 125 mil millones, una tabla de embeddings N-gram de 51 mil millones y un módulo de predicción multitoken de 4 mil millones. Según la fuente, introduce cuatro cambios arquitectónicos principales: el híbrido Gated DeltaNet con Qwen Sparse Attention, el residual con puerta, embeddings N-gram y el optimizador Muon. La reducción de parámetros activos tiene implicaciones directas para latencia y consumo de recursos en inferencia.
Rendimiento, costos y requisitos de despliegue
Alibaba reporta un costo de entrenamiento 1/9 menor comparado con Qwen3.7-Plus, un dato relevante para comprender la eficiencia del diseño. El checkpoint en precisión FP8 pesa 172,78 gigas, lo que demanda capacidad de almacenamiento y memoria sustancial en auto-hospedaje. Aunque la fuente no especifica benchmarks detallados de rendimiento frente a otros modelos multimodales de su escala, sí confirma la capacidad multimodal y la viabilidad de despliegue en infraestructura optimizada. Los modelos de lenguaje abiertos de esta magnitud cierran la brecha con soluciones propietarias en contextos específicos.
Disponibilidad y contexto en la carrera de Qwen
Qwen3.8-Flash-Next es de peso abierto, lo que permite descarga y adaptación en sistemas propios. La fuente no especifica una fecha de lanzamiento formal ni plataformas de distribución (Hugging Face, GitHub u otros) en el texto recibido, aunque el análisis sugiere disponibilidad inmediata para desarrolladores con infraestructura compatible. Este modelo sitúa a Alibaba en una posición activa dentro de la competencia de arquitecturas eficientes, adelantando características que probablemente incluirá la próxima generación Qwen4.
| Aspecto | Detalle |
|---|---|
| Modelo | Qwen3.8-Flash-Next |
| Empresa | Alibaba |
| Parámetros totales | 125 mil millones (núcleo) + 51 mil millones (embeddings N-gram) + 4 mil millones (predicción multitoken) |
| Parámetros activos por token | 6 mil millones |
| Arquitectura | Mixture-of-Experts (MoE) multimodal |
| Cambios arquitectónicos | Gated DeltaNet + Qwen Sparse Attention, residual con puerta, embeddings N-gram, optimizador Muon |
| Costo de entrenamiento | 1/9 del costo de Qwen3.7-Plus |
| Tamaño del checkpoint (FP8) | 172,78 gigas |
| Peso | Abierto (open-weight) |
| Carácter | Vista previa de arquitectura Qwen4 |
Preguntas frecuentes sobre Qwen3.8-Flash-Next
¿Cuál es el diferencial arquitectónico frente a modelos MoE anteriores?
La combinación de Gated DeltaNet con Qwen Sparse Attention, el residual con puerta y los embeddings N-gram reducen la activación de parámetros manteniendo capacidad expresiva. El optimizador Muon contribuye a estabilidad en entrenamiento, según la fuente.
¿Cuándo estará disponible y dónde descargarlo?
El texto recibido confirma que es de peso abierto pero no especifica plataforma de distribución formal ni fecha de lanzamiento exacta en el texto fuente recibido.
¿Qué requisitos de hardware necesita?
El checkpoint FP8 pesa 172,78 gigas. Para auto-hospedaje requiere memoria y almacenamiento sustancial; la fuente no especifica mínimo recomendado de VRAM o GPU concretas.
Nuestra lectura editorial
Qwen3.8-Flash-Next reafirma la estrategia de Alibaba en modelos abiertos eficientes. La reducción a 1/9 del costo de entrenamiento respecto a Qwen3.7-Plus es un dato relevante que sitúa arquitecturas MoE como alternativa viable para desarrolladores con restricciones presupuestarias. La vista previa de Qwen4 insinúa que la próxima generación integrará estos avances de manera más madura.
En Inteligencia Artificial creemos que la publicación de modelos abiertos con eficiencia mejorada acelera la democratización de capacidades multimodales. ¿Qué rol jugarán estos modelos eficientes en aplicaciones empresariales donde el costo y la latencia son críticos?
Fuente: www.marktechpost.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.