XMACNA
Gemini Robotics 2: cuando la IA empieza a coordinar todo el cuerpo

Gemini Robotics 2: cuando la IA empieza a coordinar todo el cuerpo

El Gemini Robotics 2 muestra IA coordinando todo el cuerpo, manos diestras y múltiples robots. Entiende lo que la demostración enseña a las empresas.
Equipo XMACNA

7 min de lectura

Análisis

Durante décadas, los robots industriales han sido excelentes en repetir movimientos delimitados. El desafío comienza cuando el entorno cambia, el objeto escapa de la posición prevista o una tarea requiere equilibrio, manos precisas y coordinación entre diferentes máquinas.

El video “Gemini Robotics 2 brings whole body intelligence to robots”, publicado por Google DeepMind en 30 de julio de 2026, muestra un cambio de ambición: en vez de programar una secuencia estrecha para cada cuerpo, usar un modelo generalista como capa de inteligencia capaz de percibir, decidir y actuar en el mundo físico.

Mira el video en YouTube.

La demostración organiza este avance en tres frentes: control de todo el cuerpo, destreza para manipulaciones finas y colaboración entre múltiples robots. El punto no es que toda tarea física esté resuelta. El propio video enfatiza cómo acciones simples para humanos aún son problemas difíciles para robots. Lo que cambia es la capacidad de conectar percepción, razonamiento y acción en un sistema más general.

¿Qué es la “inteligencia de todo el cuerpo”?

Para un humano, alcanzar una mesa, mantener el equilibrio, orientar el torso y posicionar la mano parece una sola acción. Para un robot, eso exige muchas decisiones distribuidas por articulaciones, sensores y actuadores.

En el video, el equipo describe Gemini Robotics como el “cerebro” que controla diferentes partes del cuerpo: el humanoide Apollo, de Apptronik; manos robóticas para movimientos delicados; y garras en plataformas de dos brazos. Esa capa de inteligencia debe transformar una instrucción de alto nivel en una secuencia física coordinada, mientras sigue lo que cambia alrededor.

El salto importante está en la generalidad. En vez de un robot espectacular para una sola coreografía, la meta es un sistema capaz de ejecutar tareas diferentes y reaccionar cuando la escena no corresponde al guion inicial.

Esta visión continúa la línea del Gemini Robotics de Google DeepMind, que combina comprensión multimodal, razonamiento sobre espacios físicos y acción. La página oficial también resalta generalidad, interactividad, destreza y adaptación a diferentes formatos de robot.

¿Por qué las manos siguen siendo una prueba tan difícil?

El segundo eje de la demostración es la destreza. Agarrar y mover un objeto rígido ya exige percepción y control. Enroscar una lámpara, manejar piezas pequeñas o manipular una bolsa flexible introduce contacto, deformación, fuerza, orientación y correcciones continuas.

El video muestra tareas que van más allá de “agarrar y colocar”. El equipo menciona que la actividad con una bolsa de basura llegó a ser considerada imposible por parte del grupo. La razón es reveladora: las personas no calculan conscientemente cada articulación de los dedos al abrir o ajustar una bolsa, pero el sistema robótico debe producir ese control fino de algún modo.

Esto hace que la destreza sea un buen indicador de madurez. Una demostración de fuerza o velocidad puede ser guionizada. Manipular objetos pequeños y variados, en condiciones que cambian, exige inteligencia física más cercana al trabajo real.

¿Cómo colaboran dos robots sin un controlador central único?

El tercer eje es la colaboración entre robots. En la escena mostrada, dos unidades reciben una tarea conjunta: colocar herramientas en un recipiente, cerrar el kit y guardarlo. Cada robot ejecuta su propia copia de la pila de inteligencia y coordina la acción por razonamiento, en lugar de depender de una red única que controle los dos cuerpos como si fueran una sola máquina.

Esta arquitectura importa porque colaboración no significa solo dividir una lista. Los agentes necesitan observar el estado compartido, evitar conflictos, reconocer lo que el otro ya hizo y ajustar el próximo movimiento.

Es un principio familiar para quien diseña sistemas agentes en el mundo digital. Varios agentes solo generan valor cuando existe estado compartido, límites de autoridad, criterios de finalización y una forma confiable de orquestación. La diferencia es que, en el mundo físico, una falla puede producir impacto material inmediato.

Lo que la demostración no prueba

El video es una presentación de capacidades, no una prueba de disponibilidad comercial amplia, autonomía irrestricta o seguridad para cualquier entorno. Debe consultarse la página pública de Google DeepMind para el estado actual de los modelos y el acceso.

Tampoco significa que el robot “entienda” el mundo como una persona. El material muestra desempeño en tareas seleccionadas y destaca el objetivo de generalidad. Para evaluar el uso real, aún importan la tasa de éxito, recuperación de fallos, latencia, límites de fuerza, supervisión, costo y desempeño fuera de las condiciones demostradas.

Esta precaución no disminuye el avance. Lo sitúa en el lugar correcto: una evidencia de que los modelos multimodales y de acción están avanzando del razonamiento digital hacia el control de sistemas físicos complejos.

¿Qué enseña esto a las empresas que todavía operan solo en digital?

La principal lección no exige comprar un humanoide. Está en el diseño de la autonomía.

Un sistema útil recibe una meta, descompone el trabajo, observa el entorno, ejecuta acciones y corrige la ruta. Pero debe hacerlo con límites. En el mundo físico, entran control de fuerza, estabilidad, zonas de seguridad y parada. En el mundo empresarial, los equivalentes son permisos, presupuesto, datos autorizados, puntos de control, trazabilidad y escalada humana.

Es el mismo principio de agentic engineering: no basta con completar una tarea. El sistema debe completarla dentro de las reglas y dejar evidencia verificable.

En XMACNA, un Empleado Digital aplica esta lógica a procesos de atención, ventas y operación. Percibe mensajes y contexto, razona sobre la etapa del proceso, actúa en los sistemas autorizados y llama a una persona cuando encuentra una excepción. El cuerpo es digital, pero el problema de coordinación es similar: entender el estado, elegir la acción correcta y no exceder la autoridad concedida.

De la automatización rígida a la adaptación gobernada

La automatización tradicional funciona muy bien cuando entrada, secuencia y resultado son previsibles. Los modelos agentes amplían el espacio de actuación porque pueden interpretar instrucciones y manejar variación. La ganancia viene acompañada de una nueva responsabilidad: gobernar decisiones que no fueron programadas una a una.

Las empresas pueden aplicar cuatro preguntas al evaluar cualquier agente, físico o digital:

  1. ¿Qué percibe? ¿Qué datos, sensores y sistemas forman su visión del entorno?
  2. ¿Qué puede decidir? ¿Cuál es el límite entre adaptación permitida y excepción?
  3. ¿Qué puede ejecutar? ¿Qué acciones, recursos e impactos están técnicamente autorizados?
  4. ¿Cómo prueba e interrumpe? ¿Qué evidencia confirma el resultado y cuál mecanismo operar cuando algo se desvía de lo esperado?

Cuanto mayor es la autonomía, más estas respuestas deben estar en la arquitectura, y no solo en un documento.

En resumen

  • El Gemini Robotics 2 es presentado por Google DeepMind como una capa de inteligencia para robots más adaptables.
  • El video destaca tres capacidades: control de todo el cuerpo, manipulación fina y colaboración entre múltiples robots.
  • Tareas triviales para humanos, como coordinar articulaciones o manejar objetos flexibles, siguen siendo difíciles para las máquinas.
  • La colaboración mostrada usa robots con sus propias instancias de inteligencia, coordinados mediante razonamiento sobre la tarea compartida.
  • La demostración no reemplaza métricas de seguridad, robustez, disponibilidad y desempeño en producción.
  • Para las empresas, la lección central es autonomía gobernada: percepción, decisión, acción, evidencia e interrupción deben diseñarse juntas.

¿Quieres descubrir dónde tu empresa ya puede cambiar la automatización rígida por una función digital adaptativa y controlada? Realiza el Diagnóstico XMACNA.

Preguntas frecuentes

¿Qué es Gemini Robotics?2

En el video de Google DeepMind, se presenta como la capa de inteligencia para la próxima generación de robots adaptables, con control de todo el cuerpo, destreza avanzada y colaboración entre robots.

¿Qué capacidades aparecen en la demostración?

Control coordinado del humanoide Apollo y otras plataformas, manipulaciones finas como manejar piezas pequeñas y objetos flexibles, además de dos robots trabajando en la misma tarea.

¿El Gemini Robotics 2 ya está disponible para cualquier empresa?

El video demuestra capacidades, pero no establece disponibilidad comercial irrestricta. El estado de acceso debe confirmarse en la página oficial de Google DeepMind.

¿Qué tiene que ver esto con los Empleados Digitales?

Ambos los casos requieren transformar objetivos en acciones adaptativas con límites. En el robot, la acción ocurre en el cuerpo físico; en el Empleado Digital, en conversaciones y sistemas empresariales. En ambos, percepción, coordinación, prueba y escalada son parte de la función.