
Google lança Gemini Robotics ER 2 com inteligência corporal completa
O que é o Gemini Robotics ER 2
O Google DeepMind lançou o Gemini Robotics ER 2, um modelo de "raciocínio incorporado" (embodied reasoning) projetado para funcionar como um cérebro de alto nível para robôs. Ele permite raciocínio espacial em tempo real, planejamento de tarefas em múltiplas etapas e colaboração entre diferentes robôs. O modelo está disponível via Gemini API, Google AI Studio e, em preview privado, na Gemini Enterprise Agent Platform.
Principais capacidades
Orquestração de ferramentas e agentes: Desenvolvedores podem declarar interfaces de controle de baixo nível - como modelos Vision-Language-Action (VLA) ou APIs de navegação - como ferramentas, e transmitir vídeo, áudio ou texto multimodal diretamente ao modelo. O ER 2 supera consistentemente o ER 1.6 em orquestração de ferramentas nos três modos de controle testados: VLA real, VLA em simulação e teleoperação humana.
Inteligência temporal: O modelo traz avanços em duas capacidades fundamentais:
- Classificação contínua de progresso: atribui a cada frame de vídeo um nível de progresso (0-100%), permitindo que robôs ajustem ações em tempo real ou repitam etapas falhas sem reiniciar todo o fluxo. Atinge 57,4% de precisão nessa tarefa.
- Localização de momentos (moment-finding): identifica o frame exato em que um evento crítico ocorre (ex.: quando parar de servir café). Atinge 91,3% de precisão com distância absoluta média de 0,96s, competindo com modelos muito maiores, mas com fração do custo computacional e 4x mais velocidade de execução.
Colaboração multi-robô: Robôs diferentes (ex.: um rover com rodas e um humanoide) podem se comunicar via entendimento semântico compartilhado para dividir e completar tarefas complexas. O Google demonstrou colaboração entre o Apollo 2 da Apptronik e o Franka F3 Duo.
Raciocínio espacial aprimorado: Melhorias em detecção de sucesso/falha (agora operando sobre feeds de vídeo brutos, não snapshots estáticos), leitura generalizada de instrumentos (10 tipos diferentes, incluindo displays digitais, réguas e termômetros) e VQA espacial.
Segurança
O ER 2 é descrito como o modelo mais seguro da linha, com ganhos significativos em benchmarks de seguimento de instruções de segurança e proximidade humana. Ele consegue parar um robô humanoide quando uma pessoa está próxima e retomar o trabalho autonomamente quando a área está livre. O Google também introduziu um benchmark que avalia a capacidade de um modelo fundacional de atuar como orquestrador VLA seguro.
Demonstração
Uma demo com o robô Spot da Boston Dynamics mostra o ER 2 orquestrando APIs de navegação e manipulação para buscar objetos por comando de linguagem natural. O código está disponível no GitHub.