Inkling-Small: modelo multimodal MoE de 12B parámetros activos

⏱ Tiempo de lectura: 3 min
Thinking Machines Lab lanzó Inkling-Small, un modelo multimodal de mezcla de expertos (MoE) con 276 mil millones de parámetros totales y 12 mil millones activos. El checkpoint NVFP4 ejecuta en una única GPU NVIDIA B300, ofreciendo capacidades similares a Inkling en un tamaño significativamente menor.
Inkling-Small: eficiencia en escala comprimida
El nuevo modelo mantiene el rendimiento de su versión anterior pero reduce el tamaño a una cuarta parte. Esta compresión permite ejecutar la arquitectura MoE en hardware más accesible. La compatibilidad con NVIDIA B300 abre caminos para despliegue en infraestructuras especializadas. Thinking Machines Lab publicó los pesos como código abierto, facilitando adopción en investigación y desarrollo empresarial. Modelos de lenguaje avanzados como este representan un cambio hacia eficiencia computacional.
Especificaciones técnicas y disponibilidad
Inkling-Small integra arquitectura multimodal, procesando texto e imágenes. Los 276 mil millones de parámetros totales con solo 12 mil millones activos responden al diseño MoE, donde no todos los parámetros se activan simultáneamente. El checkpoint NVFP4 optimiza precisión y consumo de memoria para GPU B300. Los pesos abiertos permiten investigadores y desarrolladores ejecutar, ajustar e integrar el modelo en aplicaciones propias. La fuente no especifica fecha exacta de lanzamiento ni mercados específicos de disponibilidad inicial. Más detalles en MarkTechPost.
| Aspecto | Detalle |
|---|---|
| Nombre del modelo | Inkling-Small |
| Parámetros totales | 276 mil millones |
| Parámetros activos | 12 mil millones |
| Arquitectura | Mezcla de expertos multimodal (MoE) |
| Checkpoint optimizado | NVFP4 |
| Compatibilidad de hardware | NVIDIA GPU B300 (una unidad) |
| Capacidades | Procesamiento multimodal (texto e imágenes) |
| Disponibilidad de código | Pesos abiertos (open weights) |
| Desarrollador | Thinking Machines Lab |
Qué significa para usuarios y desarrolladores
Inkling-Small democratiza el acceso a modelos multimodales grandes. Ejecutarse en una sola B300 reduce costos de infraestructura respecto a versiones más amplias. Los pesos abiertos permiten investigadores personalizar y adaptar el modelo a casos específicos sin pagar licencias. Para desarrolladores, la compresión eficiente de MoE ejemplifica cómo mantener capacidad sin escalar linealmente en computación.
Preguntas frecuentes sobre Inkling-Small
¿Cuál es la diferencia entre parámetros totales y parámetros activos?
Los modelos MoE distribuyen parámetros entre expertos especializados. Solo una fracción se activa por consulta, reduciendo costo computacional. Inkling-Small usa 12 mil millones de los 276 mil millones disponibles en cada proceso.
¿En qué se diferencia Inkling-Small de Inkling?
Inkling-Small mantiene rendimiento equivalente al modelo original con una cuarta parte del tamaño. Ambos son multimodales, pero Small optimiza para hardware más compacto.
¿Cuándo estará disponible y cuál es el costo?
La fuente no especifica fecha exacta de lanzamiento ni modelos de precios. Los pesos abiertos sugieren liberación gratuita para investigación, pero no se detallan términos de distribución específicos.
El punto clave para la comunidad tech
Thinking Machines Lab apuesta por eficiencia: capacidad de modelo grande sin infraestructura proporcional. En arquitecturas MoE, la activación selectiva de parámetros reduce consumo sin sacrificar versatilidad multimodal. Esto acelera la adopción de modelos grandes en entornos con recursos limitados.
En Inteligencia Artificial, tendencias como Inkling-Small subrayan que escala no siempre significa tamaño físico. ¿Veremos más laboratorios priorizar modelos comprimidos sobre megamodelos monolíticos?
Fuente: www.marktechpost.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.