Gemini Robotics 2: modelos de IA para robots humanoides colaborativos

⏱ Tiempo de lectura: 4 min
Google DeepMind presentó hoy la serie Gemini Robotics 2, una familia de modelos de inteligencia artificial diseñados para potenciar robots humanoides. La tecnología permite que múltiples máquinas autónomas colaboren en tareas complejas que comprenden cientos de pasos, según comunicó la división de investigación de Alphabet Inc.
Gemini Robotics 2: arquitectura dual mejorada para robots
Los robots humanoides tradicionales utilizan una arquitectura de dos sistemas de IA. El primero, llamado algoritmo de razonamiento encarnado, elabora un plan de alto nivel para realizar una tarea. Luego envía ese plan a un modelo VLA (Vision Language Action), que traduce las instrucciones en comandos de bajo nivel para los motores del robot. Gemini Robotics 2 mejora significativamente este flujo de trabajo. La serie incluye tres modelos principales que trabajan de forma integrada.
Componentes, capacidades y disponibilidad
El componente central es Gemini Robotics ER 2, un algoritmo de razonamiento encarnado que acepta instrucciones en lenguaje natural. Puede dividir tareas extensas entre varios robots para acelerar su ejecución. Incluye una función de llamada de herramientas que permite acceder a servicios en la nube, como Google Search, para aclarar partes de las instrucciones que no comprende completamente. ER 2 monitorea el progreso mediante video en vivo de las cámaras del robot: si detecta un error, identifica el último paso completado correctamente y reinicia desde allí, evitando rehacer tareas desde cero. El segundo modelo, Gemini Robotics 2, es un algoritmo VLA que controla todos los componentes del robot, no solo las manos, optimizando el centro de gravedad para reducir riesgo de caídas. Soporta una gama más amplia de manos robóticas que versiones anteriores. Gemini Robotics On-Device 2, el tercer modelo, se ejecuta directamente en las computadoras integradas de los robots y puede adaptarse a nuevas máquinas con solo horas de entrenamiento. Los desarrolladores acceden a ER 2 mediante Google Cloud, la API Gemini y Google AI Studio. DeepMind también lanzó el benchmark ASIMOV-Agentic, diseñado para evaluar la capacidad de los robots de evitar colisiones y otros riesgos. Fuente: siliconangle.com
Impacto en la autonomía robótica
La capacidad de monitoreo continuo y recuperación de errores reduce tiempos de inactividad. Robots que antes reiniciaban tareas desde el inicio ahora pueden continuar desde el punto de fallo, mejorando eficiencia operacional. La función de llamada a herramientas externas amplía el alcance de tareas sin reprogramación manual. Para organizaciones con múltiples robots, la coordinación colaborativa abre nuevas posibilidades en manufactura, logística y servicios.
| Modelo | Función | Características |
|---|---|---|
| Gemini Robotics ER 2 | Razonamiento encarnado | Interpreta lenguaje natural, monitorea video en vivo, recupera errores, acceso a servicios en la nube |
| Gemini Robotics 2 | VLA (Vision Language Action) | Controla todos los componentes, optimiza centro de gravedad, soporta múltiples manos robóticas |
| Gemini Robotics On-Device 2 | VLA local | Ejecución integrada en el robot, adaptable en horas de entrenamiento |
| ASIMOV-Agentic Benchmark | Evaluación de seguridad | Valida capacidad de evitar colisiones y riesgos |
| Acceso | Plataformas disponibles | Google Cloud, API Gemini, Google AI Studio |
Preguntas frecuentes sobre Gemini Robotics 2
¿Cuántos pasos puede automatizar Gemini Robotics 2?
Según Google DeepMind, ER 2 soporta tareas que comprenden cientos de pasos y pueden tomar varios minutos en completarse.
¿Cómo maneja los errores el modelo?
Monitorea video en vivo y, al detectar un error, identifica el último paso exitoso para reiniciar desde allí en lugar de desde el inicio.
¿Puedo ejecutar estos modelos sin conexión a la nube?
Gemini Robotics On-Device 2 se ejecuta directamente en las computadoras del robot, aunque Gemini Robotics ER 2 requiere Google Cloud, API Gemini o Google AI Studio para acceso completo.
Qué falta por confirmar
Google DeepMind no especificó fechas de disponibilidad comercial ni precios para desarrolladores. Tampoco se detalla cuánto mejora el rendimiento respecto a versiones anteriores en métricas específicas de latencia o precisión. El texto fuente no menciona compatibilidad con robots de otros fabricantes ni timeline de expansión a mercados específicos.
En Inteligencia Artificial, esta arquitectura dual mejorada representa un paso importante en autonomía robótica colaborativa. El énfasis en monitoreo visual continuo y recuperación de errores reduce fricción operacional real. ¿Veremos a estas máquinas coordinar tareas complejas en entornos industriales antes de 2027?

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.