Os modelos Google Gemini Robotics estão a impulsionar robôs mais inteligentes
Explora como o Google Gemini Robotics melhora os robôs baseados em IA com inteligência multimodal, aumentando a adaptabilidade, a destreza e a interação natural com as pessoas.

Durante décadas, os robôs simbolizaram o futuro, aparecendo em laboratórios de investigação, filmes de ficção científica e demonstrações de protótipos industriais de vanguarda. Agora, graças aos recentes avanços na inteligência artificial (AI), estes protótipos estão a ultrapassar os ambientes controlados e a entrar em aplicações do mundo real.
Especificamente, com o Gemini Robotics, a Google está a aproximar-se da tecnologia necessária para criar robôs mais inteligentes. Lançados a 12 de março de 2025, o modelo Gemini Robotics e o seu modelo complementar, Gemini Robotics-ER (Raciocínio Incorporado), são as mais recentes inovações da Google DeepMind.
São construídos sobre o Gemini 2.0, um modelo de linguagem de grande escala multimodal (LLM) que pode processar e gerar vários tipos de dados, incluindo texto, imagens, áudio e vídeo, facilitando interações mais versáteis e naturais. Estes modelos trazem as capacidades multimodais do Gemini 2.0 para o mundo físico, permitindo criar robôs mais hábeis, interativos e inteligentes.
Por exemplo, ao contrário dos robôs tradicionais, que seguem instruções fixas, os robôs integrados com modelos Gemini Robotics podem processar visão e linguagem. Isto permite-lhes tomar decisões em tempo real e adaptar-se a ambientes em mudança.
Neste artigo, vamos explorar o Gemini Robotics e o Gemini Robotics-ER, perceber como estes modelos funcionam e conhecer as suas principais funcionalidades e aplicações. Vamos começar!

Fig. 1 O Gemini Robotics ajuda os robôs a executar várias tarefas de forma eficiente.
Apresentamos o Google Gemini Robotics#
O Gemini Robotics da Google é um modelo avançado de AI concebido para dar aos robôs a capacidade de percecionar, raciocinar e interagir no mundo físico. Enquanto modelo de visão-linguagem-ação (VLA), permite aos robôs processar instruções, interpretar o ambiente e executar tarefas complexas com elevada precisão.
Entretanto, o modelo Gemini Robotics-ER melhora a capacidade de um robô compreender relações espaciais: como os objetos estão posicionados, como se movem e como interagem. Isto ajuda os robôs a antecipar ações e a ajustar os seus movimentos em conformidade.
Por exemplo, considera uma tarefa em que um robô precisa de enrolar um fio à volta de um auscultador. O Gemini Robotics-ER ajuda-o a compreender a cena, reconhecer a forma e a flexibilidade do fio, identificar a estrutura do auscultador e prever como o fio se dobrará à medida que se move. Em seguida, o Gemini Robotics traduz esta compreensão em ação, coordenando ambas as mãos para manipular suavemente o fio, ajustando a sua preensão para evitar que se enrede e garantindo um enrolamento seguro.
Ao combinar perceção e ação, o Gemini Robotics e o Gemini Robotics-ER criam um sistema inteligente que permite aos robôs executar tarefas hábeis de forma eficiente em ambientes dinâmicos.

Fig. 2 Uma visão geral da família de modelos Gemini Robotics.
AI na robótica: explorar o funcionamento do Gemini Robotics#
De seguida, vamos analisar mais detalhadamente cada modelo para compreender melhor como o Gemini Robotics e o Gemini Robotics-ER trabalham em conjunto, equilibrando flexibilidade e rapidez de ação.
Por um lado, o Gemini Robotics-ER utiliza dois mecanismos fundamentais: geração de código sem exemplos e aprendizagem no contexto com poucos exemplos (ICL). Com a geração de código sem exemplos, o modelo pode criar código para controlar o robô com base em instruções de tarefas, imagens e dados em tempo real, sem necessitar de treino adicional.
Da mesma forma, com a aprendizagem com poucos exemplos, o modelo adapta-se a novas tarefas aprendendo apenas com alguns exemplos, reduzindo a necessidade de um treino extensivo. Em conjunto, estes métodos permitem ao robô executar tarefas complexas rapidamente e adaptar-se a novos desafios com um esforço mínimo.
Por outro lado, o Gemini Robotics foi concebido para oferecer rapidez e eficiência. Utiliza um sistema híbrido constituído por um componente central baseado na nuvem e um descodificador de ações integrado. O componente central baseado na nuvem processa a informação rapidamente, com uma latência entre consulta e resposta inferior a 160 milissegundos.
Depois, o descodificador integrado ajuda a traduzir estes dados em ações em tempo real. Este sistema combinado alcança um tempo de resposta global de aproximadamente 250 milissegundos, com uma velocidade de controlo de 50 ações por segundo.

Fig. 3 Compreender como o Gemini Robotics permite o controlo de robôs em tempo real.
Principais capacidades do Gemini Robotics#
Eis uma breve visão geral das principais funcionalidades do Gemini Robotics:
-
Generalidade: Pode adaptar-se a alterações na iluminação, nos fundos e nos objetos, mantendo a precisão. Também compreende comandos reformulados ou multilíngues e pode ajustar os movimentos a diferentes condições.
-
Interatividade: Este modelo pode processar uma vasta gama de comandos em linguagem natural e responder intuitivamente. Também ajusta as suas ações com base em alterações do ambiente em tempo real, tornando-o ideal para a colaboração entre humanos e robôs.
-
Destreza: Um robô alimentado por este modelo pode executar tarefas complexas e precisas, como dobrar origami ou manusear objetos delicados. Quer se trate de um processo passo a passo ou de ações rápidas, o modelo pode ajudar a executá-las de forma eficiente.
-
Vários corpos robóticos: Funciona em várias plataformas robóticas, como sistemas de dois braços e robôs humanoides, com pouco ajuste fino. Adapta-se rapidamente a novas tarefas, mantendo um elevado desempenho.

Fig. 4. O Google Gemini Robotics funciona em várias plataformas robóticas.
Principais capacidades do Gemini Robotics-ER#
Eis algumas das principais funcionalidades do Gemini Robotics-ER que ajudam os robôs a compreender e a interagir com o mundo:
-
Deteção e rastreamento de objetos: Pode ser utilizado para identificar e rastrear objetos em espaços 2D e 3D. Através de consultas em linguagem natural, ajuda os robôs a encontrar objetos e a prever as suas posições, com base no tipo, na localização ou na função.
-
Apontamento: Esta funcionalidade permite ao modelo localizar objetos ou partes específicas numa imagem utilizando coordenadas precisas. Pode ser utilizada para ajudar os robôs a localizar objetos completos, partes de objetos ou até espaços vazios.
-
Previsão de preensão: O Gemini Robotics-ER pode ser utilizado para determinar a melhor forma de agarrar objetos com base na sua forma e função. Prevê onde agarrar, quer se trate de uma banana ou da pega de uma chávena, permitindo aos robôs manusear os objetos com cuidado.
-
Raciocínio sobre trajetórias: O modelo pode ser utilizado para planear trajetórias de movimento, prevendo sequências de ações. Por exemplo, pode orientar a mão de um robô até uma ferramenta ou definir pontos de passagem para uma tarefa específica, ajudando o robô a concluir tarefas de forma eficiente.
-
Correspondência entre múltiplas vistas: Esta funcionalidade ajuda o modelo a compreender estruturas 3D comparando a aparência dos objetos a partir de diferentes ângulos. Pode ser utilizada para melhorar o raciocínio espacial, permitindo aos robôs interagir melhor com objetos em ambientes dinâmicos.

Fig. 5 O Gemini Robotics-ER pode executar vários tipos de tarefas.
Aplicações dos modelos Google Gemini Robotics#
Agora que abordámos as principais capacidades do Gemini Robotics e do Gemini Robotics-ER, vamos analisar as suas aplicações no mundo real em vários setores.
O Google Gemini Robotics pode ser utilizado na indústria transformadora#
No que diz respeito à indústria transformadora, a precisão e a velocidade são importantes, mas é a adaptabilidade que realmente faz tudo funcionar sem problemas. Por exemplo, um robô industrial equipado com Gemini pode montar um sistema de polias identificando os componentes corretos, posicionando-os corretamente e manuseando um elástico de borracha com força precisa.
Pode esticar o elástico, passá-lo à volta das polias e fixá-lo sem o partir nem causar desalinhamentos. Se a configuração mudar ou a tarefa variar, o robô pode adaptar-se sem necessitar de uma reprogramação extensa. Esta automação inteligente reduz erros, melhora a eficiência e mantém os processos de fabrico a funcionar sem problemas.

Fig. 6 Um robô industrial de dois braços coloca com precisão um elástico de borracha num sistema de polias.
Casas inteligentes potenciadas pelo Gemini Robotics#
Os horários ocupados podem dificultar a realização das tarefas domésticas. Os robôs inteligentes podem encarregar-se de tarefas como limpar, organizar compras e até ajudar a preparar refeições, tornando a vida quotidiana mais fácil.
Isto pode traduzir-se num robô a preparar um saco de almoço, selecionando e colocando cuidadosamente os alimentos no interior enquanto ajusta a sua preensão para proteger artigos frágeis, como fruta ou latas. Mesmo que a disposição mude, o robô pode adaptar-se autonomamente, facilitando as tarefas diárias com supervisão mínima.

Fig. 7. Um robô humanoide a preparar cuidadosamente um saco de almoço.
Vantagens e desvantagens da utilização do Gemini Robotics#
O Gemini Robotics está a expandir aquilo que os robôs podem fazer, desde o fabrico de precisão até à assistência em casas inteligentes. Eis algumas das principais vantagens de utilizar o Gemini Robotics em várias aplicações:
- Requisitos mínimos de treino: Ao contrário dos robôs tradicionais, os robôs equipados com Gemini Robotics podem aprender a partir de algumas demonstrações, reduzindo os custos de treino e facilitando a sua implementação.
- Segurança reforçada: Em ambientes perigosos, os robôs integrados com o Gemini Robotics podem executar tarefas perigosas, reduzindo o risco de lesões para os trabalhadores humanos.
- Funcionalidades personalizáveis: A flexibilidade do Gemini Robotics permite adaptá-lo às necessidades específicas de diferentes setores ou empresas individuais, possibilitando aplicações especializadas e soluções únicas.
Embora o Gemini Robotics ofereça várias vantagens, também é importante abordar as seguintes limitações:
- Desafios nas relações espaciais: Estes modelos podem ter dificuldade em acompanhar relações espaciais ao longo de sequências de vídeo extensas, o que afeta a sua capacidade de rastrear e compreender objetos ao longo do tempo.
- Falta de precisão numérica: As previsões do modelo, como pontos e caixas delimitadoras, podem não ser suficientemente precisas para tarefas que exigem um controlo rigoroso, como tarefas robóticas delicadas.
- Tarefas complexas: O Gemini Robotics pode ter dificuldade em executar tarefas complexas que exigem raciocínio em várias etapas e movimentos precisos, especialmente em situações novas ou desconhecidas.
O futuro da AI na robótica#
À medida que a AI continua a avançar, modelos como o Gemini Robotics e o Gemini Robotics-ER estão a impulsionar o futuro da robótica. As melhorias futuras irão provavelmente concentrar-se no aperfeiçoamento do raciocínio em várias etapas, permitindo aos robôs dividir as tarefas em etapas lógicas para obter maior precisão.
Outra área fundamental de desenvolvimento em que a Google DeepMind planeia trabalhar é o treino baseado em simulação. Ao aprender em ambientes virtuais antes da implementação no mundo real, os robôs podem aperfeiçoar a tomada de decisões e os movimentos, minimizando os erros em aplicações práticas.
À medida que estas tecnologias evoluem, poderão abrir caminho para um futuro em que os robôs sejam mais autónomos, adaptáveis e capazes de trabalhar lado a lado com os humanos de forma integrada na vida quotidiana.
Principais conclusões#
O Gemini Robotics representa um grande avanço na automação baseada em AI, ligando a inteligência digital a tarefas físicas do mundo real. Ao combinar aprendizagem baseada em visão, linguagem e ação, estes robôs podem executar tarefas complexas com precisão e adaptabilidade.
À medida que os robôs continuam a tornar-se mais inteligentes, é provável que desempenhem um papel cada vez maior na vida quotidiana, transformando a forma como humanos e máquinas trabalham em conjunto. Este progresso aproxima-nos de um mundo inteligente e mais conectado, onde a automação baseada em AI melhora tanto os setores industriais como as tarefas do dia a dia.
Faz parte da nossa crescente comunidade! Visita o nosso repositório no GitHub para aprofundar os teus conhecimentos sobre AI. Queres começar os teus próprios projetos de visão computacional? Consulta as nossas opções de licenciamento. Sabe mais sobre AI na indústria transformadora e Vision AI no setor automóvel nas nossas páginas de soluções!









