Ultralytics YOLO27:
IA visual

Prueba de forma práctica Google Gemini 2.5 para tareas de visión artificial

Descubre de forma práctica Google Gemini 2.5 para tareas de visión artificial como la detección de objetos, la generación de descripciones de imágenes y el OCR en soluciones de IA de visión.

ABAbirami Vina9 min read
Uso de Google Gemini 2.5 para tareas de visión artificial

Los avances en IA evolucionan rápidamente, y las nuevas innovaciones acaparan titulares casi todos los días. Uno de los avances recientes es Gemini 2.5, el último modelo multimodal de Google DeepMind, presentado el 26 de marzo. Mientras que los modelos de lenguaje de gran tamaño (LLMs) tradicionales pueden aprender a partir de enormes cantidades de datos para generar texto similar al humano, Gemini 2.5 va más allá.

Está diseñado como un «modelo de razonamiento» capaz de procesar imágenes, audio y vídeo. Tiene mejores capacidades de razonamiento y programación. Curiosamente, también ofrece un rendimiento excepcional en tareas de visión por computador, en las que las máquinas interpretan y analizan datos visuales, como la detección de objetos, la generación de pies de imagen y el reconocimiento óptico de caracteres (OCR).

Uso de Gemini 2.5 para comprender el contenido de una imagen

Fig. 1. Ejemplo del uso de Gemini 2.5 para comprender el contenido de una imagen.

En este artículo, repasaremos uno de los cuadernos de Ultralytics que puede ayudarte a poner en práctica las capacidades de visión por computador de Gemini 2.5. También analizaremos más de cerca las características clave de Gemini 2.5 y mostraremos cómo se puede utilizar para crear soluciones de visión por computador para aplicaciones del mundo real. ¡Empecemos!

Descripción general de Gemini 2.5: características y capacidades#

La primera versión de la serie de modelos Gemini 2.5 que se acaba de lanzar es una versión experimental de Gemini 2.5 Pro. Está diseñada para abordar problemas complejos razonando sobre sus respuestas antes de dar una contestación. Utiliza métodos como el aprendizaje por refuerzo (en el que el modelo aprende a partir de los comentarios) y el prompting de cadena de pensamiento (un enfoque paso a paso para resolver problemas).

Una de sus características clave es su enorme ventana de contexto, que puede contener 1 millón de tokens (aproximadamente un millón de palabras o fragmentos de palabras) y se espera que crezca hasta los 2 millones. Esto significa que el modelo puede procesar mucha información de una vez, lo que produce resultados más detallados y precisos.

Además de procesar lenguaje, Gemini 2.5 se puede utilizar para las siguientes tareas de visión por computador:

  • Detección de objetos: es el proceso de identificar y localizar objetos dentro de una imagen. Se puede utilizar en aplicaciones como la videovigilancia o los vehículos autónomos.

  • Generación de pies de imagen: esta tarea consiste en generar un texto descriptivo para una imagen. Hace que el contenido visual sea más accesible y fácil de comprender.

  • Reconocimiento óptico de caracteres: esta tecnología convierte el texto presente en las imágenes en texto editable y legible por máquinas. Resulta útil para digitalizar documentos y automatizar la introducción de datos.

Evaluación comparativa y comparación de Google Gemini 2.5 con otros modelos#

Actualmente hay varios modelos multimodales disponibles en el ámbito de la IA, por lo que es importante entender cómo se compara Gemini 2.5 Pro con ellos. Según los resultados de las evaluaciones comparativas compartidos por DeepMind de Google, Gemini 2.5 Pro muestra un rendimiento impresionante en una amplia variedad de tareas.

Por ejemplo, en una prueba llamada Humanity’s Last Exam, que simula un examen exigente sobre muchas materias y evalúa el razonamiento avanzado y los conocimientos generales, Gemini 2.5 Pro obtiene aproximadamente un 18,8 %, superando a modelos como o3-mini de OpenAI, que obtiene alrededor de un 14 %.

Descripción general del rendimiento de Gemini 2.5 Pro en las evaluaciones comparativas

Fig. 2. Descripción general del rendimiento de Gemini 2.5 Pro en las evaluaciones comparativas.

También ofrece un rendimiento muy bueno en retos matemáticos y de programación, igualando o superando a menudo el rendimiento de modelos como OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta y DeepSeek R1, lo que demuestra su capacidad para abordar tareas complejas y procesar grandes cantidades de datos.

Práctica con Gemini 2.5: cómo utilizar la API de Google Gemini#

Gemini 2.5 Pro está disponible en varias plataformas. Puedes experimentar con él en Google AI Studio y acceder a él mediante la aplicación Gemini si eres usuario de Gemini Advanced. En su anuncio de lanzamiento, Google DeepMind también mencionó que el modelo será compatible próximamente con Vertex AI. Estos puntos de acceso facilitan que los desarrolladores utilicen Gemini 2.5 Pro en aplicaciones de IA del mundo real.

Sin embargo, si quieres utilizar la API de Google Gemini y empezar en solo unos minutos sin una configuración complicada, además de comprender mejor sus capacidades de visión por computador, puedes consultar el cuaderno de Ultralytics, que muestra tareas como la detección de objetos y la generación de pies de imagen mediante Gemini 2.5 Pro. Veamos en detalle qué puedes esperar del cuaderno.

Configuración de la inferencia con el cuaderno de Google Gemini 2.5#

Para empezar a utilizar el cuaderno de Ultralytics y Google Gemini 2.5, primero tendrás que generar una clave de API mediante Google AI Studio. Esta clave te da acceso a la API de Gemini para que puedas utilizar el modelo.

Cuando tengas la clave de API, asegúrate de que tu entorno tenga instaladas las bibliotecas necesarias; entre ellas se incluyen paquetes de Ultralytics y el kit de herramientas de IA de Google. Este paso se explica claramente en el cuaderno, por lo que puedes seguir fácilmente las instrucciones para configurar tu espacio de trabajo.

Una vez configurado todo, puedes conectarte a la API de Gemini introduciendo tu clave de API (como se muestra a continuación), lo que crea un vínculo entre tu espacio de trabajo y el modelo. Después, podrás enviar imágenes y prompts de texto a Gemini 2.5.

Básicamente, puedes proporcionar al modelo una imagen y una instrucción sencilla (como «detecta objetos en esta imagen» o «describe lo que ves»), y este devolverá los resultados que necesitas. Este proceso directo facilita empezar a explorar las capacidades de visión por computador de Gemini 2.5.

Detección de objetos con Google Gemini 2.5#

Uno de los ejemplos clave del cuaderno es la detección de objetos mediante Gemini 2.5 Pro. En este ejemplo, proporcionas al modelo una imagen y un prompt sencillo para detectar objetos.

El modelo procesa la imagen y devuelve un conjunto de coordenadas y etiquetas para cada objeto que encuentra; estas coordenadas se proporcionan en forma normalizada. A continuación, se utilizan funciones del paquete de Python de Ultralytics para convertir estos valores normalizados de modo que coincidan con las dimensiones reales de la imagen y dibujar BBox claros alrededor de cada objeto, como se muestra a continuación.

Uso de Google Gemini 2.5 para la detección de objetos

Fig. 3. Uso de Google Gemini 2.5 para la detección de objetos.

Generación de pies de imagen mediante Gemini 2.5#

Otro ejemplo interesante del cuaderno es la generación de pies de imagen mediante Gemini 2.5 Pro. En este ejemplo, proporcionas al modelo una imagen y un prompt en el que le pides que genere un pie detallado que describa lo que aparece en la imagen.

A continuación, el modelo analiza el contenido visual y devuelve una narración, a menudo formada por varias frases, que recoge tanto el contenido como el contexto de la imagen. Esta función resulta útil para mejorar la accesibilidad, resumir información visual e incluso potenciar la narración creativa.

Mejora de la precisión del OCR con los modelos de Google Gemini#

Una tarea de visión por computador que aprovecha la capacidad de Gemini 2.5 Pro para leer texto en imágenes es el OCR. En el cuaderno, puedes proporcionar al modelo una imagen que contenga texto junto con un prompt para extraerlo. El modelo procesa la imagen y devuelve tanto el texto detectado como las coordenadas donde se encuentra, como se muestra a continuación.

A continuación, se utilizan funciones del paquete de Python de Ultralytics para convertir estas coordenadas normalizadas a las dimensiones reales de la imagen y dibujar BBox alrededor de las regiones de texto. Este resultado anotado deja claro dónde se encuentra el texto, lo que resulta útil para digitalizar documentos, automatizar la introducción de datos y mejorar la accesibilidad.

Extracción de datos textuales de una imagen mediante Google Gemini 2.5

Fig. 4. Extracción de datos textuales de una imagen mediante Google Gemini 2.5.

Aplicaciones de Google Gemini 2.5 en el mundo real#

Ahora que hemos repasado cómo se puede utilizar Google Gemini 2.5 Pro para diversas tareas de visión por computador, exploremos algunas aplicaciones del mundo real en las que se pueden utilizar estas capacidades.

Por ejemplo, la capacidad de Gemini 2.5 Pro para detectar objetos puede ayudar a etiquetar y organizar automáticamente grandes conjuntos de imágenes, haciendo que tareas como la creación de un dataset o la gestión de contenidos sean mucho más rápidas. También se puede utilizar para analizar imágenes en sectores como el comercio minorista y la agricultura; por ejemplo, para detectar productos en estanterías o identificar signos de estrés de los cultivos en fotografías de explotaciones agrícolas.

Gemini 2.5 Pro analizando la salud de una planta

Fig. 5. Gemini 2.5 Pro analizando la salud de una planta.

Por su parte, la función de generación de pies de imagen del modelo puede ayudar a los usuarios con discapacidad visual a comprender qué aparece en una imagen. Por ejemplo, si tienes una fotografía de una calle concurrida, el modelo podría generar un pie que describa la escena en detalle, mencionando los tipos de vehículos, la actividad de los peatones e incluso la hora del día basándose en las condiciones de iluminación.

Además, la funcionalidad de OCR de Gemini 2.5 se puede utilizar en diversas aplicaciones. Por ejemplo, puedes digitalizar documentos impresos escaneando páginas o recibos. Esta capacidad es ideal para automatizar tareas de introducción de datos, procesar formularios o incluso leer texto de tarjetas de visita y carteles.

En conjunto, Google Gemini 2.5 Pro abre las puertas a una amplia variedad de aplicaciones prácticas de IA.

Conclusiones clave#

Más allá de generar y analizar texto, Google Gemini 2.5 Pro se puede utilizar para tareas de visión por computador como la detección de objetos, la generación de pies de imagen y el OCR. Gracias a su enorme ventana de contexto y a sus mejores capacidades de razonamiento, produce resultados detallados y conscientes del contexto que funcionan bien en situaciones del mundo real.

A medida que los modelos de IA siguen evolucionando, herramientas como Gemini 2.5 Pro facilitan la resolución de problemas complejos en distintos sectores. Es probable que veamos una adopción aún más amplia de la IA a medida que más organizaciones busquen soluciones multimodales y flexibles capaces de abordar una amplia variedad de tareas, desde la comprensión visual hasta el procesamiento del lenguaje.

Forma parte de nuestra comunidad y descubre proyectos de IA de vanguardia en nuestro repositorio de GitHub. Conoce las aplicaciones de la IA visual en la agricultura y el papel de la IA en la fabricación en nuestras páginas de soluciones. Explora nuestros planes de licencia y crea soluciones de visión por computador hoy mismo.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático