Qwen3.8-Flash-Next: el modelo MoE de Alibaba que adelanta Qwen4

⏱ Tiempo de lectura: 4 min

Alibaba presentó Qwen3.8-Flash-Next, un modelo multimodal de arquitectura Mixture-of-Experts (MoE) de peso abierto que activa solo 6 mil millones de parámetros por token, aunque cuenta con 125 mil millones en su núcleo. La publicación en MarkTechPost detalla que este lanzamiento funciona como vista previa de la arquitectura Qwen4, mostrando avances en eficiencia de entrenamiento y despliegue.

Parámetros, arquitectura y cambios clave de Qwen3.8-Flash-Next

El modelo distribuye sus 125 mil millones de parámetros en una estructura de columna vertebral de 125 mil millones, una tabla de embeddings N-gram de 51 mil millones y un módulo de predicción multitoken de 4 mil millones. Según la fuente, introduce cuatro cambios arquitectónicos principales: el híbrido Gated DeltaNet con Qwen Sparse Attention, el residual con puerta, embeddings N-gram y el optimizador Muon. La reducción de parámetros activos tiene implicaciones directas para latencia y consumo de recursos en inferencia.

Rendimiento, costos y requisitos de despliegue

Alibaba reporta un costo de entrenamiento 1/9 menor comparado con Qwen3.7-Plus, un dato relevante para comprender la eficiencia del diseño. El checkpoint en precisión FP8 pesa 172,78 gigas, lo que demanda capacidad de almacenamiento y memoria sustancial en auto-hospedaje. Aunque la fuente no especifica benchmarks detallados de rendimiento frente a otros modelos multimodales de su escala, sí confirma la capacidad multimodal y la viabilidad de despliegue en infraestructura optimizada. Los modelos de lenguaje abiertos de esta magnitud cierran la brecha con soluciones propietarias en contextos específicos.

Disponibilidad y contexto en la carrera de Qwen

Qwen3.8-Flash-Next es de peso abierto, lo que permite descarga y adaptación en sistemas propios. La fuente no especifica una fecha de lanzamiento formal ni plataformas de distribución (Hugging Face, GitHub u otros) en el texto recibido, aunque el análisis sugiere disponibilidad inmediata para desarrolladores con infraestructura compatible. Este modelo sitúa a Alibaba en una posición activa dentro de la competencia de arquitecturas eficientes, adelantando características que probablemente incluirá la próxima generación Qwen4.

Aspecto Detalle
Modelo Qwen3.8-Flash-Next
Empresa Alibaba
Parámetros totales 125 mil millones (núcleo) + 51 mil millones (embeddings N-gram) + 4 mil millones (predicción multitoken)
Parámetros activos por token 6 mil millones
Arquitectura Mixture-of-Experts (MoE) multimodal
Cambios arquitectónicos Gated DeltaNet + Qwen Sparse Attention, residual con puerta, embeddings N-gram, optimizador Muon
Costo de entrenamiento 1/9 del costo de Qwen3.7-Plus
Tamaño del checkpoint (FP8) 172,78 gigas
Peso Abierto (open-weight)
Carácter Vista previa de arquitectura Qwen4

Preguntas frecuentes sobre Qwen3.8-Flash-Next

¿Cuál es el diferencial arquitectónico frente a modelos MoE anteriores?

La combinación de Gated DeltaNet con Qwen Sparse Attention, el residual con puerta y los embeddings N-gram reducen la activación de parámetros manteniendo capacidad expresiva. El optimizador Muon contribuye a estabilidad en entrenamiento, según la fuente.

¿Cuándo estará disponible y dónde descargarlo?

El texto recibido confirma que es de peso abierto pero no especifica plataforma de distribución formal ni fecha de lanzamiento exacta en el texto fuente recibido.

¿Qué requisitos de hardware necesita?

El checkpoint FP8 pesa 172,78 gigas. Para auto-hospedaje requiere memoria y almacenamiento sustancial; la fuente no especifica mínimo recomendado de VRAM o GPU concretas.

Nuestra lectura editorial

Qwen3.8-Flash-Next reafirma la estrategia de Alibaba en modelos abiertos eficientes. La reducción a 1/9 del costo de entrenamiento respecto a Qwen3.7-Plus es un dato relevante que sitúa arquitecturas MoE como alternativa viable para desarrolladores con restricciones presupuestarias. La vista previa de Qwen4 insinúa que la próxima generación integrará estos avances de manera más madura.

En Inteligencia Artificial creemos que la publicación de modelos abiertos con eficiencia mejorada acelera la democratización de capacidades multimodales. ¿Qué rol jugarán estos modelos eficientes en aplicaciones empresariales donde el costo y la latencia son críticos?

Fuente: www.marktechpost.com

Deja una respuesta

Subir