LFM2.5-VL-3B: modelo visión-lenguaje de 3B parámetros con herramientas

⏱ Tiempo de lectura: 4 min
Liquid AI presentó LFM2.5-VL-3B, un modelo de visión-lenguaje de 3.1 mil millones de parámetros diseñado para ejecutarse directamente en dispositivos sin conexión a servidores. El modelo alcanza un promedio de 80.7 en ScreenSpot-v2 y mejora significativamente el anclaje de objetos en RefCOCO, pasando de 57.1 a 87.9. Una novedad importante es la integración de capacidad de llamadas a funciones en la línea VL, elevando ToolSandbox de 26.4 a 59.5, lo que permite que el modelo maneje tareas complejas sin depender de servicios en la nube.
Rendimiento y especificaciones del modelo
El modelo ocupa aproximadamente 3 GB de almacenamiento, lo que lo hace viable para dispositivos con recursos limitados. En hardware Apple M5 Max, alcanza una velocidad de decodificación de 228 tokens por segundo. Estas métricas sugieren un equilibrio entre capacidad computacional y eficiencia, permitiendo aplicaciones en dispositivos móviles y computadoras personales. Los modelos de lenguaje compactos son cada vez más relevantes para usuarios que requieren privacidad y autonomía sin depender de infraestructura en la nube.
Capacidades específicas confirmadas
El modelo demuestra tres capacidades principales: lectura y comprensión de interfaces de pantalla (ScreenSpot), anclaje espacial de objetos detectados en imágenes (RefCOCO) y llamadas a funciones que permiten al modelo interactuar con herramientas externas. La mejora de 30.8 puntos en RefCOCO refleja un avance significativo en precisión de localización visual. La nueva capacidad de ToolSandbox (aumento de 33.1 puntos) marca la primera integración formal de function calling en la línea de modelos visión-lenguaje de Liquid AI. Fuente: MarkTechPost
Qué se puede esperar ahora
LFM2.5-VL-3B abre caminos para aplicaciones que requieren procesamiento visual en tiempo real sin enviar datos a servidores externos. Empresas y desarrolladores pueden integrar comprensión de pantalla, detección de objetos y automatización de tareas en aplicaciones locales. La eficiencia energética y de almacenamiento favorece su adopción en entornos con limitaciones de recursos, desde dispositivos móviles hasta sistemas embebidos.
| Dato | Detalle |
|---|---|
| Modelo | LFM2.5-VL-3B |
| Parámetros | 3.1 mil millones |
| ScreenSpot-v2 | Promedio de 80.7 |
| RefCOCO (anclaje) | 57.1 → 87.9 |
| ToolSandbox (funciones) | 26.4 → 59.5 |
| Tamaño | ~3 GB |
| Velocidad (Apple M5 Max) | 228 tokens/segundo |
| Despliegue | En dispositivo (sin nube) |
Preguntas frecuentes sobre LFM2.5-VL-3B
¿Qué diferencia a este modelo de otros visión-lenguaje compactos?
La integración de function calling es nueva en la línea VL de Liquid AI, permitiendo que el modelo no solo comprenda imágenes y pantallas, sino que también ejecute acciones mediante herramientas. El rendimiento en RefCOCO (87.9) lo posiciona entre los más precisos en anclaje espacial a este tamaño.
¿En qué dispositivos se puede ejecutar?
Cualquier dispositivo con al menos 3 GB de almacenamiento disponible puede ejecutarlo localmente. Apple M5 Max alcaniza 228 tokens/segundo; otros procesadores tendrán velocidades diferentes no especificadas en la fuente.
¿Cuándo estará disponible?
No se especifica fecha de lanzamiento en el texto fuente recibido. Tampoco aparecen detalles sobre licenciamiento, API pública o acceso en repositorios conocidos.
La lectura para quienes usan IA a diario
Este modelo es relevante si desarrollas aplicaciones que necesitan privacidad de datos, procesamiento sin latencia de red o funcionamiento en dispositivos con recursos limitados. La mejora en anclaje espacial abre posibilidades para automatización de flujos visuales: desde asistentes que leen interfaces hasta robots que necesitan ubicar objetos con precisión.
En Inteligencia Artificial vemos en LFM2.5-VL-3B una tendencia hacia modelos especializados, compactos y con capacidades de herramientas integradas. ¿Cuál es tu principal caso de uso para un modelo de visión que funciona sin conexión?
Fuente: www.marktechpost.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.