Liquid AI lanza LFM2.5-DSpark con inferencia 3.2x más rápida

Liquid AI lanza LFM2.5-DSpark con inferencia 3.2x más rápida

⏱ Tiempo de lectura: 3 min

Liquid AI lanzó el 20 de agosto de 2026 puntos de control de decodificación especulativa para tres modelos de su familia LFM2.5, reportando ganancias de rendimiento de hasta 3.18x en una GPU H100 única y hasta 2.87x en MacBook con silicio de Apple, sin cambios en las salidas del modelo. LFM2.5-DSpark introduce borradores optimizados que aceleran la inferencia mediante predicción anticipada de tokens.

Ganancias de rendimiento en inferencia con LFM2.5-DSpark

La nueva versión cubre borradores para LFM2.5-1.2B-Instruct, LFM2.5-2.6B y el modelo de expertos mixtos LFM2.5-8B-A1B. Cada borrador añade aproximadamente 300 millones de parámetros de sobrecarga en relación al modelo objetivo. Los puntos de control se han lanzado con arquitectura optimizada para reducir latencia sin sacrificar precisión en las respuestas generadas por los modelos base.

Especificaciones técnicas y capacidades confirmadas

Los modelos cubren tres rangos de tamaño: 1.2B parámetros en versión Instruct, 2.6B parámetros en versión base y 8B parámetros en configuración de expertos mixtos. La decodificación especulativa funciona mediante predicción de continuación de secuencias antes de que el modelo principal genere cada token. Las pruebas muestran aceleraciones en H100 GPU hasta 3.18x y en procesadores Apple hasta 2.87x. Los modelos de lenguaje compactos como estos optimizan el balance entre capacidad y eficiencia computacional. Disponibilidad y formato de distribución en www.unite.ai.

Modelo Parámetros Ganancia H100 Ganancia Apple Silicon
LFM2.5-1.2B-Instruct 1.2B + 300M draft Hasta 3.18x Hasta 2.87x
LFM2.5-2.6B 2.6B + 300M draft Hasta 3.18x Hasta 2.87x
LFM2.5-8B-A1B 8B MoE + 300M draft Hasta 3.18x Hasta 2.87x

Qué falta por confirmar

El texto fuente no especifica el formato de distribución final (Hugging Face, GitHub, API pública), precio o acceso de suscripción. Tampoco aclara compatibilidad con otros aceleradores más allá de H100 y Apple Silicon. El impacto real en flujos de producción dependerá de validación en casos de uso reales y ajuste fino de parámetros del modelo borrador.

Preguntas frecuentes sobre LFM2.5-DSpark

¿Cuánto se aceleró exactamente la inferencia?

Liquid AI reporta hasta 3.18x de ganancia en throughput en una GPU H100 única y hasta 2.87x en Apple Silicon. La aceleración proviene de decodificación especulativa con modelos borradores de aproximadamente 300 millones de parámetros adicionales.

¿Está disponible para descargar ahora?

Se lanzó el 20 de agosto de 2026. El texto fuente no especifica plataforma de distribución, modelo de acceso ni si requiere acuerdo de licencia. Consulta directamente con Liquid AI o su repositorio oficial.

¿Funciona con mi hardware?

Las pruebas confirmadas incluyen H100 GPU y procesadores Apple Silicon. Compatibilidad con otros aceleradores (A100, L40, TPU) no se especifica en el texto fuente recibido.

La lectura para quienes usan IA a diario

Si trabajas con modelos compactos en producción, la decodificación especulativa reduce latencia sin reentrenamiento, ideal para aplicaciones de tiempo real. Validar las ganancias reportadas en tu infraestructura específica sigue siendo esencial antes de migrar flujos completos.

En Inteligencia Artificial consideramos que optimizaciones de velocidad sin degradación de salida abren espacios para desplegar modelos menores en hardware limitado. ¿Tu equipo utiliza decodificación especulativa en otras herramientas?

Fuente: www.unite.ai

Deja una respuesta

Subir