Inkling-Small: modelo multimodal MoE de 12B parámetros activos

⏱ Tiempo de lectura: 3 min

Thinking Machines Lab lanzó Inkling-Small, un modelo multimodal de mezcla de expertos (MoE) con 276 mil millones de parámetros totales y 12 mil millones activos. El checkpoint NVFP4 ejecuta en una única GPU NVIDIA B300, ofreciendo capacidades similares a Inkling en un tamaño significativamente menor.

Inkling-Small: eficiencia en escala comprimida

El nuevo modelo mantiene el rendimiento de su versión anterior pero reduce el tamaño a una cuarta parte. Esta compresión permite ejecutar la arquitectura MoE en hardware más accesible. La compatibilidad con NVIDIA B300 abre caminos para despliegue en infraestructuras especializadas. Thinking Machines Lab publicó los pesos como código abierto, facilitando adopción en investigación y desarrollo empresarial. Modelos de lenguaje avanzados como este representan un cambio hacia eficiencia computacional.

Especificaciones técnicas y disponibilidad

Inkling-Small integra arquitectura multimodal, procesando texto e imágenes. Los 276 mil millones de parámetros totales con solo 12 mil millones activos responden al diseño MoE, donde no todos los parámetros se activan simultáneamente. El checkpoint NVFP4 optimiza precisión y consumo de memoria para GPU B300. Los pesos abiertos permiten investigadores y desarrolladores ejecutar, ajustar e integrar el modelo en aplicaciones propias. La fuente no especifica fecha exacta de lanzamiento ni mercados específicos de disponibilidad inicial. Más detalles en MarkTechPost.

Aspecto Detalle
Nombre del modelo Inkling-Small
Parámetros totales 276 mil millones
Parámetros activos 12 mil millones
Arquitectura Mezcla de expertos multimodal (MoE)
Checkpoint optimizado NVFP4
Compatibilidad de hardware NVIDIA GPU B300 (una unidad)
Capacidades Procesamiento multimodal (texto e imágenes)
Disponibilidad de código Pesos abiertos (open weights)
Desarrollador Thinking Machines Lab

Qué significa para usuarios y desarrolladores

Inkling-Small democratiza el acceso a modelos multimodales grandes. Ejecutarse en una sola B300 reduce costos de infraestructura respecto a versiones más amplias. Los pesos abiertos permiten investigadores personalizar y adaptar el modelo a casos específicos sin pagar licencias. Para desarrolladores, la compresión eficiente de MoE ejemplifica cómo mantener capacidad sin escalar linealmente en computación.

Preguntas frecuentes sobre Inkling-Small

¿Cuál es la diferencia entre parámetros totales y parámetros activos?

Los modelos MoE distribuyen parámetros entre expertos especializados. Solo una fracción se activa por consulta, reduciendo costo computacional. Inkling-Small usa 12 mil millones de los 276 mil millones disponibles en cada proceso.

¿En qué se diferencia Inkling-Small de Inkling?

Inkling-Small mantiene rendimiento equivalente al modelo original con una cuarta parte del tamaño. Ambos son multimodales, pero Small optimiza para hardware más compacto.

¿Cuándo estará disponible y cuál es el costo?

La fuente no especifica fecha exacta de lanzamiento ni modelos de precios. Los pesos abiertos sugieren liberación gratuita para investigación, pero no se detallan términos de distribución específicos.

El punto clave para la comunidad tech

Thinking Machines Lab apuesta por eficiencia: capacidad de modelo grande sin infraestructura proporcional. En arquitecturas MoE, la activación selectiva de parámetros reduce consumo sin sacrificar versatilidad multimodal. Esto acelera la adopción de modelos grandes en entornos con recursos limitados.

En Inteligencia Artificial, tendencias como Inkling-Small subrayan que escala no siempre significa tamaño físico. ¿Veremos más laboratorios priorizar modelos comprimidos sobre megamodelos monolíticos?

Fuente: www.marktechpost.com

Deja una respuesta

Subir