Gemini Robotics 2.0: dexteridad mejorada en robots humanoides

Gemini Robotics 2.0: dexteridad mejorada en robots humanoides

⏱ Tiempo de lectura: 3 min

Google DeepMind presentó Gemini Robotics 2.0, una actualización de su sistema de inteligencia artificial para robots que mejora significativamente la destreza, la capacidad de análisis en tiempo real y la colaboración entre máquinas. La nueva versión incluye tres submodelos, uno de los cuales está disponible para desarrolladores desde hoy. El objetivo es crear robots generalistas capaces de realizar cualquier tarea que un humano pueda hacer.

Modelos mejorados para control robótico avanzado

El corazón de la actualización es Gemini Robotics ER 2, un modelo de razonamiento encarnado que Google DeepMind describe como un salto significativo respecto a la versión 1.6. Este modelo de visión-lenguaje procesa feeds de video en vivo de las cámaras del robot, permitiendo que el sistema rastree el progreso mientras la máquina ejecuta tareas paso a paso. Puede clasificar la completitud de fotogramas de video con casi 60% de precisión, superando significativamente versiones anteriores y modelos competidores. La capacidad más destacada es identificar momentos clave en secuencias de video con casi 90% de precisión, fundamental para tareas como saber cuándo dejar de verter café.

Capacidades clave y disponibilidad

ER 2 permite que los robots entiendan fallos en tiempo real durante tareas multietapa, readaptándose sin volver al inicio. Esto significa que si una pelota rueda mientras intenta recogerla, el robot ajusta su posición sin reiniciar. Google también lanzó Gemini Robotics 2, un modelo de visión-lenguaje-acción que genera instrucciones de movimiento, y Gemini Robotics On-Device 2, una versión offline de baja latencia. Ambos están limitados a probadores beta, aunque ER 2 está disponible vía Gemini Live API para desarrolladores. Los nuevos modelos de acción son más precisos y eficientes; la versión en dispositivo puede adaptarse a nuevos diseños robóticos con solo 200 ejemplos de movimiento o pocas horas de datos. Los videos de demostración muestran a los robots Apollo 2 de Apptronik y Franka F3 Duo colaborando en tareas sin interferirse.

Seguridad y medidas preventivas

Google DeepMind integró capas de seguridad física tradicional con marcos de seguridad de IA robustos en cada capa de Gemini Robotics. Presentó ASIMOV-Agentic, un nuevo benchmark de seguridad que evalúa si los modelos rechazan comandos inseguros, determinan si una tarea es completable de forma segura y solicitan asistencia humana cuando hay incertidumbre. Según DeepMind, ER 2 es su modelo más seguro hasta la fecha, mostrando capacidad sólida para entender riesgos y detener acciones cuando un humano está demasiado cerca. El benchmark completo está disponible en Hugging Face.

Qué falta por confirmar

Aunque los robots aún no alcanzan la velocidad y gracia humanas, los videos muestran avances reales en hesitación y fluidez. No se especifican en el texto de fuentes fechas de lanzamiento general para los modelos de acción o cronogramas para salida del programa beta. El impacto práctico en manufactura, logística o servicios dependerá de adopción real en el mundo físico.

Modelo Capacidad / Estado
Gemini Robotics ER 2 Razonamiento encarnado; procesa video en vivo; 60% exactitud en completitud de fotogramas; 90% en identificación de momentos clave. Disponible vía Gemini Live API para desarrolladores
Gemini Robotics 2 Modelo visión-lenguaje-acción; genera instrucciones de movimiento. En beta limitado
Gemini Robotics On-Device 2 Versión offline de baja latencia; adapta nuevos diseños con 200 ejemplos de movimiento. En beta limitado
ASIMOV-Agentic Benchmark de seguridad; evalúa rechazo de comandos inseguros, viabilidad segura de tareas y solicitud de asistencia humana. Disponible en Hugging Face

Preguntas frecuentes sobre Gemini Robotics 2.0

¿Cuándo estará disponible Gemini Robotics 2.0 para el público?

Gemini Robotics ER 2 está disponible vía Gemini Live API para desarrolladores desde el anuncio. Los modelos de acción (Gemini Robotics 2 y On-Device 2) están en programa beta limitado. No se especifica fecha de lanzamiento general.

¿Qué robots pueden usar estos modelos?

Los videos de demostración muestran Apollo 2 de Apptronik y Franka F3 Duo. ER 2 puede controlar robots humanoides completos, incluyendo manos humanoides complejas. On-Device 2 puede adaptarse a nuevos diseños con pocas horas de datos de movimiento.

¿Hay costo para desarrolladores o es de acceso libre?

No se especifica en el texto fuente recibido si hay costo, tier de acceso o plan de suscripción para usar los modelos.

Qué conviene mirar de cerca

El salto en precisión de video (90% en momentos clave) y la capacidad de adaptarse sin reiniciar son avances reales. El énfasis en seguridad mediante ASIMOV-Agentic responde a riesgos legítimos de IA física. La colaboración robot-a-robot sin interferencia plantea escenarios concretos para manufactura y logística.

En Inteligencia Artificial, este anuncio marca un paso hacia robots menos frágiles y más autónomos, aunque la visión de "AGI física" sigue siendo aspiracional. ¿Veremos robots de DeepMind fuera de laboratorios en 2027?

Fuente: arstechnica.com

Deja una respuesta

Subir