Google lanza su primer modelo de robótica IA sin dependencia del cloud
En el mundo de la IA solemos llamar «robots» a chatbots como Gemini o ChatGPT, pero la realidad es que la inteligencia artificial generativa está jugando un papel cada vez más importante en robots físicos reales. Google DeepMind, tras anunciar Gemini Robotics a principios de año, acaba de presentar un nuevo modelo VLA (Vision Language Action) para controlar robots que funciona completamente en el dispositivo. A diferencia de la versión anterior, este no necesita ningún componente en la nube, lo que permite a los robots operar con total autonomía.
¿Por qué importa un modelo de robótica sin cloud?
Carolina Parada, directora de robótica en Google DeepMind, explica que este enfoque podría hacer que los robots sean mucho más fiables en situaciones complicadas. Además, es la primera versión del modelo de robótica de Google que los desarrolladores pueden ajustar para sus necesidades específicas.
La robótica presenta un desafío único para la IA porque, además de existir en el mundo físico, el robot también modifica su entorno. Ya sea moviendo bloques o atando tus cordones, es prácticamente imposible predecir todas las situaciones que un robot podría encontrar. El enfoque tradicional de entrenar robots mediante refuerzo era extremadamente lento, pero la IA generativa permite una generalización mucho mayor.
«El sistema aprovecha la comprensión multimodal del mundo de Gemini para realizar tareas completamente nuevas», explica Parada. «De la misma manera que Gemini puede producir texto, escribir poesía, resumir un artículo, generar código o crear imágenes, también puede generar acciones para robots.»
Robots generales, sin nube necesaria
En la versión anterior de Gemini Robotics (que sigue siendo la versión «superior» de la tecnología robótica de Google), las plataformas ejecutaban un sistema híbrido: un modelo pequeño en el robot y otro más grande funcionando en la nube. Seguramente has visto cómo los chatbots «piensan» durante segundos mientras generan una respuesta, pero los robots necesitan reaccionar rápidamente. Si le pides a un robot que recoja y mueva un objeto, no quieres que se quede parado mientras genera cada paso. El modelo local permite adaptación rápida, mientras que el modelo basado en servidor puede ayudar con tareas de razonamiento complejas.
Ahora Google DeepMind ha lanzado el modelo local como un VLA independiente, y sorprende su robustez. El nuevo Gemini Robotics On-Device es solo ligeramente menos preciso que la versión híbrida. Según Parada, muchas tareas funcionarán sin problema desde el primer momento: «Cuando jugamos con los robots, vemos que son sorprendentemente capaces de entender situaciones nuevas.»
Al lanzar este modelo con un SDK completo, el equipo espera que los desarrolladores asignen nuevas tareas a los robots controlados por Gemini y los prueben en nuevos entornos, lo que podría revelar acciones que no funcionan con la calibración predeterminada. Con el SDK, los investigadores podrán adaptar el VLA a nuevas tareas con tan solo 50 a 100 demostraciones.
Una «demostración» en robótica con IA es diferente de otras áreas de investigación en IA. Parada explica que las demostraciones típicamente implican teleoperación del robot —controlar la maquinaria manualmente para completar una tarea ajusta el modelo para manejar esa tarea de forma autónoma. Aunque los datos sintéticos son un elemento del entrenamiento de Google, no sustituyen a los datos reales. «Todavía encontramos que para los comportamientos más complejos y que requieren destreza, necesitamos datos reales», dice Parada. «Pero hay bastante que se puede hacer con simulación.»
Limitaciones del modelo sin conexión
Los comportamientos extremadamente complejos pueden estar más allá de las capacidades del VLA integrado en el dispositivo. No debería tener problemas con acciones sencillas como atar un zapato (una tarea tradicionalmente difícil para los robots con IA) o doblar una camisa. Sin embargo, si quisieras que un robot te preparara un sándwich, probablemente necesitaría un modelo más potente para realizar el razonamiento de múltiples pasos necesario.
El equipo ve Gemini Robotics On-Device como ideal para entornos donde la conectividad a la nube es irregular o inexistente. Procesar los datos visuales del robot localmente también es mejor para la privacidad, por ejemplo, en un entorno sanitario.
Construyendo robots seguros
La seguridad siempre es una preocupación con los sistemas de IA, ya sea un chatbot que proporciona información peligrosa o un robot que se vuelve rebelde estilo Terminator. Todos hemos visto cómo los chatbots y generadores de imágenes alucinan falsedades en sus resultados, y los sistemas generativos que impulsan Gemini Robotics no son diferentes: el modelo no acierta siempre, pero darle al modelo una encarnación física con frías pinzas metálicas hace que el problema sea un poco más espinoso.
Para garantizar que los robots se comporten de manera segura, Gemini Robotics utiliza un enfoque de múltiples capas. «Con el Gemini Robotics completo, te conectas a un modelo que está razonando sobre lo que es seguro hacer», dice Parada. «Y luego ese modelo habla con un VLA que produce opciones, y ese VLA llama a un controlador de bajo nivel, que típicamente tiene componentes críticos de seguridad, como cuánta fuerza puedes mover o qué tan rápido puedes mover este brazo.»
Es importante destacar que el nuevo modelo incorporado es solo un VLA, por lo que los desarrolladores deberán implementar sus propias medidas de seguridad. Google sugiere que repliquen lo que ha hecho el equipo de Gemini. Se recomienda a los desarrolladores en el programa de pruebas que conecten el sistema a la API estándar de Gemini Live, que incluye una capa de seguridad, y que implementen un controlador de bajo nivel para verificaciones críticas de seguridad.
Evolución y futuro de la robótica IA
Cualquiera interesado en probar Gemini Robotics On-Device debe solicitar acceso al programa de probadores de confianza de Google. Carolina Parada señala que ha habido muchos avances en robótica en los últimos tres años, y esto es solo el principio: la versión actual de Gemini Robotics todavía se basa en Gemini 2.0.
Parada menciona que el equipo de Gemini Robotics normalmente va una versión por detrás del desarrollo de Gemini, y Gemini 2.5 ha sido citado como una mejora masiva en la funcionalidad de los chatbots. Quizás lo mismo será cierto para los robots.
El detector de IA para robots: un futuro necesario
Con el avance de estos sistemas, surge una pregunta importante: ¿necesitaremos detectores de IA especializados para distinguir entre acciones robóticas autónomas y aquellas controladas por humanos? Actualmente los detectores de IA se centran principalmente en contenido generado como texto o imágenes, pero el campo de la robótica plantea nuevos desafíos.
A medida que estos robots se vuelven más sofisticados, podría ser crucial desarrollar sistemas que puedan identificar cuándo un robot está operando autónomamente y cuándo está siendo teleoperado, especialmente en entornos sensibles como hospitales o instalaciones de seguridad.
La nueva frontera para los generadores de imágenes IA
Si bien el modelo de Google se centra en controlar robots físicos, existe una conexión interesante con los generadores de imágenes IA. Los mismos principios de comprensión visual y contextual que perm


