Cohere lanza North Small Translate, modelo de traducción con 218B parámetros

Cohere lanza North Small Translate, modelo de traducción con 218B parámetros

⏱ Tiempo de lectura: 3 min

Cohere presentó el 10 de septiembre de 2026 North Small Translate, un modelo de traducción de código abierto con arquitectura sparse mixture-of-experts que suma 218 mil millones de parámetros totales y 25 mil millones activos. El modelo está bajo licencia CC BY-NC 4.0 para investigación y uso no comercial, con soporta declarado para más de 50 idiomas y un contexto de entrada y salida de 16 mil tokens.

North Small Translate: especificaciones y rendimiento confirmados

Cohere reportó un puntaje WMT26 de 83,60 para North Small Translate en el benchmark que evalúa capacidades generales de traducción automática entre idiomas, dominios y géneros. Una variante agentic multi-pass alcanzó 84,36 puntos, diseñada para detectar y corregir errores en las traducciones. En la evaluación de Cohere con GPT-5.6-Sol como juez, Qwen 3.5 397B A17B puntuó 81,56; DeepL NextGen 81,37; Gemma 4 31B 79,46; GLM 5.2 FP8 76,50 y Google Translate 68,20. El modelo soporta arquitectura decoder-only con 128 expertos de los cuales ocho se activan por token, junto a expertos compartidos aplicados en cada token. Las capas de atención intercalan atención de ventana deslizante (tamaño 4.096 con Rotary Positional Embeddings) con capas de atención global sin embeddings posicionales en proporción 3:1, diseño que fue introducido primero en Command A.

Rendimiento regional, contexto extendido y throughput confirmados

En evaluación de contexto largo midiendo traducción de dos capítulos completos en una sola llamada, North Small Translate puntuó 48,9 contra 21,3 de Google Translate y 19,4 de Gemma 4 31B según xComet-XL. Regionalmente, el modelo superó Gemma 4 31B en Europa 82,2 a 73,9, funcionó parejo en Asia del Sur 86,2 a 86,7 y venció DeepL NextGen en todas las regiones no europeas: entre 8 a 10 puntos en Asia del Sur y MENA, aproximadamente 4 a 5 puntos en Sudeste Asiático y 1 a 3 puntos en Asia Oriental. En throughput, Cohere midió hasta 1,4 veces más throughput de salida que Gemma 4 31B TP1: 112 frente a 81 tokens de salida por segundo en baja concurrencia y 39 contra 30 en alta concurrencia. Para licencias comerciales, Cohere reportó puntuación 80,1 a $0,000676 por tarea usando 661 tokens en promedio, versus Gemini 3.1 Pro Preview (high) a $0,038928 por tarea (5.762% más) y Qwen 3.5 397B A17B a $0,004525 por tarea. Los modelos de lenguaje especializados avanzan en precisión y eficiencia operativa.

Disponibilidad, hardware mínimo y asociación con RWS

Los pesos están alojados en Hugging Face con descarga controlada que requiere compartir información de contacto. Las variantes incluyen BF16 (requiere cuatro GPUs B200 u ocho H100), FP8 (dos B200 o cuatro H100) y NVFP4 W4A16 (una B200 o dos H100). El modelo está disponible en la API gratuita de Cohere a través del Chat V2 API bajo el ID north-small-translate-1-0 hasta alcanzar límites de tasa, con licencias comerciales y despliegue a través de Model Vault con hardware sugerido de dos H100 o una B200. Cohere desarrolló el modelo en asociación con RWS, empresa especializada en soluciones de IA para tecnología lingüística. RWS trabaja con más del 80% de las 100 marcas principales globales. Según comunicado de Cohere del 1 de junio de 2026, RWS probó Command A Translate en julio de 2025 y para septiembre de 2025 ambos equipos iniciaron trabajo en modelo especializado que resultó en Language Weaver Pro, que logró 55% de victorias a nivel oración contra DeepL NextGen en evaluaciones humanas.

Qué falta por confirmar

Los benchmarks señalan North Small Translate como modelo dedicado de traducción de mejor rendimiento promedio entre idiomas en la evaluación de Cohere, aunque la métrica WMT26 ofrece un cuadro de rendimiento objetivo. El impacto real dependerá de adopción en entornos de producción y validación independiente. La integración en Language Weaver Pro de RWS indica demanda empresarial concreta en localización y soporte al cliente multilingüe. Para equipos hispanohablantes, la compatibilidad confirmada con más de 50 idiomas debe verificarse incluyendo español en todos sus variantes regionales.

Elemento Especificación
Modelo North Small Translate (sparse mixture-of-experts)
Parámetros totales 218 mil millones; 25 mil millones activos
Fecha de lanzamiento 10 de septiembre de 2026
Licencia CC BY-NC 4.0 (investigación y uso no comercial)
Idiomas soportados Más de 50: inglés, árabe, francés, alemán, hindi, japonés, coreano, ruso, ucraniano, vietnamita, chino simplificado y tradicional, más 38 variantes regionalizadas
Contexto entrada/salida 16 mil tokens ambos
Puntaje WMT26 (estándar) 83,60
Puntaje WMT26 (variante agentic) 84,36
Contexto extendido (xComet-XL) 48,9 vs. Google Translate 21,3 y Gemma 4 31B 19,4
Throughput (baja concurrencia) 112 tokens salida/segundo vs. Gemma 4 81
Throughput (alta concurrencia) 39 tokens salida/segundo vs. Gemma 4 30
Arquitectura Decoder-only, 128 expertos (8 activos por token), atención ventana deslizante 4.096 + atención global ratio 3:1
Variantes de cuantización BF16 (4 B200 u 8 H100), FP8 (2 B200 o 4 H100), NVFP4 W4A16 (1 B200 o 2 H100)
Disponibilidad Código abierto en Hugging Face (acceso controlado); API gratuita Cohere (Chat V2); licencia comercial vía Model Vault
Precio comercial reportado $0,000676 por tarea (661 tokens promedio)
Asociación RWS (Language Weaver Pro: 55% victorias oración vs. DeepL NextGen, evaluación humana)

Preguntas frecuentes sobre North Small Translate

¿Cuál es la arquitectura técnica de North Small Translate?

Sparse mixture-of-experts Transformer con 128 expertos y 8 activos por token, más expertos compartidos en cada token. Atención intercalada: ventana deslizante 4.096 (Rotary Positional Embeddings) alternada con atención global sin embeddings posicionales en ratio 3:1, patrón introducido primero en Command A.

¿Cuándo fue lanzado y dónde descargarlo?

Lanzado el 10 de septiembre de 2026. Los pesos están en Hugging Face con acceso controlado (requiere contacto), bajo licencia CC BY-NC 4.0. También disponible en API gratuita de Cohere (Chat V2 API) y licencia comercial vía Model Vault.

¿Cuál es el costo y configuración de hardware mínima?

Gratuito hasta límites de tasa en API Cohere. Comercialmente: $0,000676 por tarea reportado. Hardware mínimo: una B200 o dos H100 GPUs en cuantización W4A4; configuraciones mayores según variante (BF16 requiere hasta 8 H100).

Qué conviene mirar de cerca

La asociación con RWS y Language Weaver Pro señala adopción empresarial real en localización global. Los benchmarks de Cohere muestran ventajas sostenidas en contexto extendido (traducción de capítulos completos) respecto a modelos generales, un caso de uso frecuente en traducción de documentación y contenido profesional. La confirmación de más de 50 idiomas requiere validación que incluya variantes del español según necesidad regional.

En Inteligencia Artificial, los modelos especializados en traducción avanzan con eficiencia comparable o superior a alternativas cerradas, reduciendo costos operativos para equipos de localización. ¿Impactará esto en la adopción de traducción automática en empresas hispanohablantes con alto volumen de contenido multilingüe?

Fuente: www.unite.ai

Deja una respuesta

Subir