Ultralytics YOLO27:
IA visual

Los modelos Google Gemini Robotics están impulsando robots más inteligentes

Descubre cómo Google Gemini Robotics mejora los robots basados en IA con inteligencia multimodal, aumentando su adaptabilidad, destreza e interacción fluida con las personas.

ABAbirami Vina10 min read
Los modelos Google Gemini Robotics impulsan robots más inteligentes

Durante décadas, los robots han simbolizado el futuro, apareciendo en laboratorios de investigación, películas de ciencia ficción y demostraciones de prototipos industriales de vanguardia. Ahora, gracias a los recientes avances en la inteligencia artificial (AI), estos prototipos están saliendo de los entornos controlados para adentrarse en aplicaciones del mundo real.

En concreto, con Gemini Robotics, Google se acerca un paso más a la tecnología necesaria para crear robots más inteligentes. Lanzados el 12 de marzo de 2025, el modelo Gemini Robotics y su modelo complementario, Gemini Robotics-ER (razonamiento incorporado), son las últimas innovaciones de Google DeepMind.

Se basan en Gemini 2.0, un modelo de lenguaje de gran tamaño multimodal (LLM) capaz de procesar y generar distintos tipos de datos, como texto, imágenes, audio y vídeo, lo que facilita interacciones más versátiles y naturales. Estos modelos trasladan las capacidades multimodales de Gemini 2.0 al mundo físico, permitiendo crear robots más diestros, interactivos e inteligentes.

Por ejemplo, a diferencia de los robots tradicionales, que siguen instrucciones fijas, los robots integrados con modelos Gemini Robotics pueden procesar información visual y lenguaje. Esto les permite tomar decisiones en tiempo real y adaptarse a entornos cambiantes.

En este artículo, exploraremos Gemini Robotics y Gemini Robotics-ER, cómo funcionan estos modelos y sus principales características y aplicaciones. ¡Empecemos!

Gemini Robotics ayuda a los robots a realizar varias tareas de forma eficiente

Fig. 1. Gemini Robotics ayuda a los robots a realizar varias tareas de forma eficiente.

Presentamos Google Gemini Robotics#

Gemini Robotics de Google es un modelo avanzado de AI diseñado para dotar a los robots de la capacidad de percibir, razonar e interactuar en el mundo físico. Como modelo de visión-lenguaje-acción (VLA), permite a los robots procesar instrucciones, interpretar su entorno y ejecutar tareas complejas con gran precisión.

Por su parte, el modelo Gemini Robotics-ER mejora la capacidad de un robot para comprender las relaciones espaciales: cómo están colocados los objetos, cómo se mueven y cómo interactúan. Esto ayuda a los robots a anticipar acciones y ajustar sus movimientos en consecuencia.

Por ejemplo, imagina una tarea en la que un robot tiene que enrollar un cable alrededor de unos auriculares. Gemini Robotics-ER le ayuda a comprender la escena, reconocer la forma y flexibilidad del cable, identificar la estructura de los auriculares y predecir cómo se doblará el cable al moverse. Después, Gemini Robotics traduce esta comprensión en acciones, coordinando ambas manos para manipular el cable con suavidad, ajustando el agarre para evitar que se enrede y garantizando un enrollado seguro.

Al combinar percepción y acción, Gemini Robotics y Gemini Robotics-ER crean un sistema inteligente que permite a los robots realizar tareas diestras de forma eficiente en entornos dinámicos.

Descripción general de la familia de modelos Gemini Robotics

Fig. 2. Descripción general de la familia de modelos Gemini Robotics.

La AI en la robótica: cómo funciona Gemini Robotics#

A continuación, analizaremos más detenidamente cada modelo para comprender mejor cómo Gemini Robotics y Gemini Robotics-ER trabajan conjuntamente para equilibrar la flexibilidad y la rapidez de acción.

Por un lado, Gemini Robotics-ER aprovecha dos mecanismos clave: la generación de código zero-shot y el aprendizaje en contexto con pocos ejemplos (ICL). Con la generación de código zero-shot, el modelo puede crear código para controlar el robot a partir de instrucciones de tareas, imágenes y datos en tiempo real, sin necesidad de entrenamiento adicional.

Del mismo modo, con el aprendizaje con pocos ejemplos, el modelo se adapta a nuevas tareas aprendiendo a partir de tan solo unos pocos ejemplos, lo que reduce la necesidad de un entrenamiento exhaustivo. En conjunto, estos métodos permiten al robot realizar tareas complejas con rapidez y adaptarse a nuevos retos con un esfuerzo mínimo.

Gemini Robotics, por otro lado, está diseñado para ofrecer rapidez y eficiencia. Utiliza un sistema híbrido formado por una base alojada en la nube y un decodificador de acciones integrado. La base alojada en la nube procesa la información rápidamente, con una latencia de consulta a respuesta inferior a 160 milisegundos.

A continuación, el decodificador integrado ayuda a traducir estos datos en acciones en tiempo real. Este sistema combinado consigue un tiempo de respuesta total aproximado de 250 milisegundos, con una velocidad de control de 50 acciones por segundo.

Cómo Gemini Robotics permite controlar robots en tiempo real

Fig. 3. Comprende cómo Gemini Robotics permite controlar robots en tiempo real.

Principales capacidades de Gemini Robotics#

Estas son, brevemente, las principales características de Gemini Robotics:

  • Generalidad: Puede adaptarse a cambios en la iluminación, los fondos y los objetos sin perder precisión. También comprende órdenes parafraseadas o multilingües y puede ajustar sus movimientos a distintas condiciones.

  • Interactividad: Este modelo puede procesar una amplia variedad de órdenes en lenguaje natural y responder de forma intuitiva. También ajusta sus acciones según los cambios del entorno en tiempo real, por lo que resulta ideal para la colaboración entre personas y robots.

  • Destreza: Un robot equipado con este modelo puede realizar tareas complejas y precisas, como doblar origami o manipular objetos delicados. Tanto si se trata de un proceso paso a paso como de acciones rápidas, el modelo puede ayudar a ejecutarlas de forma eficiente.

  • Múltiples encarnaciones: Funciona en diversas plataformas robóticas, como sistemas de dos brazos y robots humanoides, con pocos ajustes. Se adapta rápidamente a nuevas tareas manteniendo un alto rendimiento.

Google Gemini Robotics funcionando en diversas plataformas robóticas

Fig. 4. Google Gemini Robotics funciona en diversas plataformas robóticas.

Principales capacidades de Gemini Robotics-ER#

Estas son algunas de las principales características de Gemini Robotics-ER que ayudan a los robots a comprender e interactuar con el mundo:

  • Detección de objetos y seguimiento: Puede utilizarse para identificar y seguir objetos tanto en espacios 2D como 3D. Mediante consultas en lenguaje natural, ayuda a los robots a encontrar objetos y predecir sus posiciones, ya sea según su tipo, ubicación o función.

  • Señalamiento: Esta función permite al modelo localizar objetos o partes concretas dentro de una imagen mediante coordenadas precisas. Puede utilizarse para ayudar a los robots a localizar objetos completos, partes de objetos o incluso espacios vacíos.

  • Predicción del agarre: Gemini Robotics-ER puede utilizarse para determinar la mejor forma de agarrar objetos según su forma y función. Predice dónde agarrar, ya sea un plátano o el asa de una taza, lo que permite a los robots manipular los objetos con cuidado.

  • Razonamiento sobre trayectorias: El modelo puede planificar rutas de movimiento prediciendo secuencias de acciones. Por ejemplo, puede guiar la mano de un robot hacia una herramienta o definir puntos de referencia para una tarea concreta, ayudando al robot a completar las tareas de forma eficiente.

  • Correspondencia multivista: Esta función ayuda al modelo a comprender estructuras 3D comparando el aspecto de los objetos desde distintos ángulos. Puede utilizarse para mejorar el razonamiento espacial y permitir que los robots interactúen mejor con los objetos en entornos dinámicos.

Gemini Robotics-ER realizando diversos tipos de tareas

Fig. 5. Gemini Robotics-ER puede realizar diversos tipos de tareas.

Aplicaciones de los modelos Google Gemini Robotics#

Ahora que hemos analizado las principales capacidades de Gemini Robotics y Gemini Robotics-ER, veamos sus aplicaciones en el mundo real en diversos sectores.

Google Gemini Robotics puede utilizarse en la fabricación#

En la fabricación, la precisión y la velocidad son importantes, pero la adaptabilidad es lo que realmente permite que todo funcione sin problemas. Por ejemplo, un robot industrial equipado con Gemini puede montar un sistema de poleas identificando los componentes adecuados, colocándolos correctamente y manipulando una banda elástica con una fuerza precisa.

Puede estirar la banda, pasarla alrededor de las poleas y fijarla sin romperla ni desalinearla. Si cambia la configuración o varía la tarea, el robot puede adaptarse sin necesidad de una reprogramación exhaustiva. Esta automatización inteligente reduce los errores, mejora la eficiencia y mantiene los procesos de fabricación en funcionamiento sin problemas.

Un robot industrial de dos brazos colocando una banda elástica en un sistema de poleas

Fig. 6. Un robot industrial de dos brazos coloca con precisión una banda elástica en un sistema de poleas.

Hogares inteligentes gracias a Gemini Robotics#

Los horarios ocupados pueden dificultar la realización de las tareas domésticas. Los robots inteligentes pueden encargarse de tareas como limpiar, clasificar la compra e incluso ayudar a preparar comidas, haciendo que la vida cotidiana sea más fácil.

Esto podría consistir en que un robot prepare una bolsa de comida, seleccionando y colocando cuidadosamente los alimentos en su interior mientras ajusta el agarre para proteger artículos frágiles, como fruta o latas. Aunque cambie la disposición, el robot puede adaptarse por sí solo y facilitar las tareas diarias con una supervisión mínima.

Un robot humanoide preparando cuidadosamente una bolsa de comida

Fig. 7. Un robot humanoide preparando cuidadosamente una bolsa de comida.

Ventajas e inconvenientes de utilizar Gemini Robotics#

Gemini Robotics está ampliando las posibilidades de los robots, desde la fabricación de precisión hasta la asistencia inteligente en el hogar. Estas son algunas de las principales ventajas de utilizar Gemini Robotics en diversas aplicaciones:

  • Requisitos de entrenamiento mínimos: A diferencia de los robots tradicionales, los robots controlados por Gemini Robotics pueden aprender a partir de unas pocas demostraciones, lo que reduce los costes de entrenamiento y facilita su implementación.
  • Mayor seguridad: En entornos peligrosos, los robots integrados con Gemini Robotics pueden realizar tareas peligrosas, reduciendo el riesgo de lesiones para los trabajadores humanos.
  • Funciones personalizables: La flexibilidad de Gemini Robotics permite adaptarlo para satisfacer las necesidades específicas de distintos sectores o empresas concretas, posibilitando aplicaciones especializadas y soluciones únicas.

Aunque Gemini Robotics ofrece varias ventajas, también es importante abordar las siguientes limitaciones:

  • Dificultades con las relaciones espaciales: Estos modelos pueden tener problemas para seguir las relaciones espaciales durante secuencias de vídeo largas, lo que afecta a su capacidad para seguir y comprender los objetos a lo largo del tiempo.
  • Falta de precisión numérica: Las predicciones del modelo, como los puntos y las cajas delimitadoras, pueden no ser lo bastante precisas para tareas que requieren un control minucioso, como las tareas robóticas delicadas.
  • Tareas complejas: Gemini Robotics puede tener dificultades para realizar tareas complejas que requieren razonamiento en varios pasos y movimientos precisos, especialmente en situaciones nuevas o desconocidas.

El futuro de la AI en la robótica#

A medida que la AI sigue avanzando, modelos como Gemini Robotics y Gemini Robotics-ER están impulsando el futuro de la robótica. Es probable que las mejoras futuras se centren en perfeccionar el razonamiento en varios pasos, permitiendo que los robots dividan las tareas en pasos lógicos para lograr una mayor precisión.

Otro ámbito de desarrollo clave en el que Google DeepMind planea trabajar es el entrenamiento basado en simulación. Al aprender en entornos virtuales antes de implementarse en el mundo real, los robots pueden perfeccionar su toma de decisiones y sus movimientos, minimizando los errores en aplicaciones prácticas.

A medida que estas tecnologías evolucionen, podrían abrir el camino a un futuro en el que los robots sean más autónomos, adaptables y capaces de trabajar junto a las personas de forma fluida en la vida cotidiana.

Conclusiones clave#

Gemini Robotics supone un gran avance en la automatización impulsada por AI, conectando la inteligencia digital con las tareas físicas del mundo real. Al combinar visión, lenguaje y aprendizaje basado en acciones, estos robots pueden realizar tareas complejas con precisión y adaptabilidad.

A medida que los robots sigan volviéndose más inteligentes, es probable que desempeñen un papel más importante en la vida cotidiana, cambiando la forma en que las personas y las máquinas trabajan juntas. Este progreso nos acerca a un mundo inteligente y más conectado, donde la automatización impulsada por AI mejora tanto los sectores industriales como las tareas diarias.

¡Forma parte de nuestra creciente comunidad! Visita nuestro repositorio de GitHub para profundizar en la AI. ¿Quieres empezar tus propios proyectos de visión por ordenador? Echa un vistazo a nuestras opciones de licencia. Descubre más sobre la AI en la fabricación y la AI de visión en el sector de la automoción en nuestras páginas de soluciones.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático