INTELIGENCIA CORPORAL
Google DeepMind lanza Gemini Robotics 2 para control integral de robots
DeepMind presenta tres modelos que permiten a robots humanoides caminar, manipular objetos con precisión y trabajar en equipo. El sistema adapta la misma IA a distintos cuerpos robóticos en horas.

Google DeepMind presentó Gemini Robotics 2, un sistema de tres modelos de IA que permite a robots humanoides controlar todo su cuerpo de forma inteligente, desde los pies hasta los dedos de las manos. Según publicó DeepMind, el avance representa un salto desde robots preprogramados para tareas repetitivas hacia máquinas que razonan cada movimiento y se adaptan a entornos impredecibles.
El sistema ya demostró capacidad para hacer que un robot humanoide Apollo 2 de Apptronik camine, se agache, estire y manipule objetos para limpiar espacios desordenados. Lo relevante: el mismo checkpoint del modelo funciona en tres plataformas robóticas distintas sin reentrenamiento completo.
Tres modelos para tres funciones
Gemini Robotics 2 funciona como un vision-language-action model (VLA) que convierte visión y lenguaje en control motor. Controla humanoides completos y robots de doble brazo, incluyendo manos de cinco dedos con 22 grados de libertad.
Gemini Robotics ER 2 actúa como el cerebro de alto nivel: un vision language model (VLM) que procesa instrucciones humanas, razona sobre el mundo físico y planifica tareas de varios minutos. Introduce además la capacidad de coordinar múltiples robots trabajando en equipo.
Gemini Robotics On-Device 2 es la versión optimizada para correr localmente en el hardware del robot. Logra adaptación rápida a cuerpos robóticos completamente nuevos con solo unas pocas horas de datos.
De la mesa a todo el cuerpo
La versión anterior de Gemini Robotics controlaba solo la parte superior del cuerpo para tareas de mesa. Gemini Robotics 2 extiende el control a movimientos corporales completos. En una demostración, el robot Apollo 2 recibió la instrucción "poné la regadera en el contenedor verde del estante inferior". El robot procesó la orden, caminó hasta la mesa, levantó la regadera, se desplazó hasta los estantes y la colocó en el destino preciso.
En destreza fina, el modelo controla la mano SharpaWave de cinco dedos en Apollo 2 para acciones delicadas como atar nudos o sellar bolsas ziplock. También opera grippers paralelos de dos dedos en plataformas Franka Duo para tareas complejas como empaquetado ajustado.
Disponibilidad escalonada
Gemini Robotics ER 2 ya está disponible en Google AI Studio y en preview privado en Gemini Enterprise Agent Platform. Los modelos VLA y On-Device están en acceso temprano para partners. DeepMind publicó documentación para desarrolladores sobre cómo integrar estos modelos en hardware propio.
Por qué importa
La robótica llevaba décadas estancada en automatización de tareas específicas por preprogramación o teleoperación. Transferir habilidades aprendidas entre distintos cuerpos robóticos era extremadamente difícil. Gemini Robotics 2 resuelve dos problemas estructurales: permite que un robot razone sobre sus movimientos en lugar de seguir secuencias fijas, y logra que el mismo modelo funcione en plataformas físicas diferentes.
Para empresas evaluando automatización, esto significa poder usar un mismo sistema de IA en distintos tipos de robots según la tarea —humanoides para espacios diseñados para humanos, brazos duales para manufactura, grippers para logística— sin desarrollar software específico para cada máquina. La capacidad de adaptación en horas en lugar de meses reduce la barrera de entrada.
El modelo de razonamiento (ER 2) disponible en AI Studio abre la posibilidad de que equipos de producto experimenten con planificación robótica antes de comprometer inversión en hardware. La ejecución on-device elimina dependencia de conectividad permanente, crítico para entornos industriales.
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.