LFM2.5-VL-3B: modelo de visión-lenguaje compacto de Liquid AI

⏱ Tiempo de lectura: 3 min

Liquid AI presentó LFM2.5-VL-3B, un modelo de visión y lenguaje con 3.1 mil millones de parámetros diseñado para ejecutarse directamente en dispositivos sin conexión a servidores. El modelo alcanza una puntuación promedio de 80.7 en ScreenSpot-v2 y mejora significativamente el reconocimiento de objetos, elevando RefCOCO de 57.1 a 87.9. Una característica nueva es la capacidad de llamar funciones de herramientas, donde ToolSandbox pasó de 26.4 a 59.5.

Desempeño compacto y velocidad en hardware de consumidor

El modelo ocupa aproximadamente 3 GB de almacenamiento y decodifica 228 tokens por segundo en un Apple M5 Max, lo que lo hace viable para máquinas modernas sin aceleración especializada. Este modelo de lenguaje multimodal combina lectura de pantallas, localización precisa de objetos y ejecución de funciones en un solo formato compacto. La arquitectura permite que usuarios sin equipamiento de cómputo costoso ejecuten capacidades avanzadas de forma local, reduciendo latencia y dependencia de APIs remotas.

Benchmarks exactos y casos de uso

ScreenSpot-v2 evalúa comprensión de interfaces gráficas con un puntaje promedio de 80.7. RefCOCO mide localización espacial de objetos en imágenes, mejorando de 57.1 a 87.9. ToolSandbox valida capacidad de invocar funciones externas, pasando de 26.4 a 59.5. El consumo de energía y memoria reducidos hacen viable el despliegue en laptops, tablets y teléfonos inteligentes con capacidades de procesamiento visual y lenguaje integradas. La fuente no especifica en el texto recibido fecha exacta de disponibilidad pública ni términos de licencia. Más detalles en MarkTechPost.

Parámetro Detalle
Nombre del modelo LFM2.5-VL-3B
Parámetros 3.1 mil millones
ScreenSpot-v2 80.7 promedio
RefCOCO (grounding) 57.1 → 87.9
ToolSandbox (funciones) 26.4 → 59.5
Tamaño en disco ~3 GB
Velocidad (M5 Max) 228 tokens/segundo
Despliegue En dispositivo, sin API remota

Preguntas frecuentes sobre LFM2.5-VL-3B

¿Qué mejoras trae este modelo respecto a versiones anteriores?

Integra capacidad de llamada de funciones (nueva en la línea VL), mejora significativa en localización de objetos y lectura precisa de pantallas. Cada métrica de referencia muestra saltos de dos dígitos en rendimiento absoluto.

¿En qué dispositivos puedo ejecutar LFM2.5-VL-3B?

El texto fuente recibido menciona Apple M5 Max con 228 tokens/segundo. La fuente no especifica compatibilidad explícita con otros procesadores, sistemas operativos o plataformas móviles Android o Linux.

¿Cuál es el costo de usar este modelo?

No se especifica en el texto fuente recibido si es de acceso gratuito, bajo licencia comercial, de código abierto o requiere suscripción. Tampoco se detallan planes de API o términos de uso.

El punto clave para la comunidad tech

LFM2.5-VL-3B reduce la brecha entre capacidades de modelos grandes (70+ mil millones de parámetros) y requisitos de hardware accesible. Para desarrolladores e investigadores, ofrece multimodalidad funcional sin depender de proveedores de API remotos, permitiendo privacidad de datos y control local sobre inferencias visuales y de lenguaje.

En Inteligencia Artificial, la compresión de modelos multimodales a 3 GB sin pérdida crítica de precisión es un avance práctico que acelera adopción en entornos empresariales con restricciones de ancho de banda o latencia cero. ¿Veremos este patrón replicarse en otros laboratorios de IA durante 2026?

Fuente: www.marktechpost.com

Deja una respuesta

Subir