YOLO Vision 2026:
IA de visión

Empieza a trabajar con Google Gemini 2.5 para tareas de visión artificial

Descubre cómo puedes empezar a trabajar con Google Gemini 2.5 para tareas de visión artificial como detección de objetos, descripción de imágenes y OCR para soluciones de IA de visión.

ABAbirami Vina5 min read
Uso de Google Gemini 2.5 para tareas de visión artificial

Los avances en inteligencia artificial avanzan rápidamente, y las nuevas innovaciones acaparan los titulares casi todos los días. Uno de estos avances recientes es Gemini 2.5, el modelo multimodal más reciente de Google DeepMind, lanzado el 26 de marzo. Si bien los Large Language Models (LLMs) tradicionales pueden aprender de grandes cantidades de datos para generar texto similar al humano, Gemini 2.5 va más allá.

Está diseñado como un "modelo de pensamiento" capaz de procesar imágenes, audio y vídeo. Cuenta con habilidades mejoradas de razonamiento y programación. Curiosamente, también rinde de manera excepcional en computer vision tasks, donde las máquinas interpretan y analizan datos visuales, como la detección de objetos, la generación de subtítulos para imágenes y el reconocimiento óptico de caracteres (OCR).

Using Gemini 2.5 to understand the contents of an image

Fig 1. Ejemplo del uso de Gemini 2.5 para comprender el contenido de una imagen.

En este artículo, recorreremos uno de los notebooks de Ultralytics que te ayuda a familiarizarte con las capacidades de visión por computadora de Gemini 2.5. También analizaremos más de cerca las características clave de Gemini 2.5 y mostraremos cómo se puede usar para construir computer vision solutions en aplicaciones del mundo real. ¡Empecemos!

Descripción general de Gemini 2.5: características y capacidades#

La primera versión de la serie de modelos Gemini 2.5 que se acaba de lanzar es una versión experimental de Gemini 2.5 Pro. Está diseñada para manejar problemas complejos pensando en sus respuestas antes de ofrecer una solución. Utiliza métodos como el aprendizaje por refuerzo (donde el modelo aprende de la retroalimentación) y el prompting de cadena de pensamiento (un enfoque paso a paso para resolver problemas).

Una de sus características clave es su enorme ventana de contexto, que puede albergar 1 millón de tokens (aproximadamente un millón de palabras o partes de palabras) y se espera que crezca hasta los 2 millones. Esto significa que el modelo puede recibir mucha información a la vez, lo que conduce a resultados más detallados y precisos.

Además de procesar lenguaje, Gemini 2.5 se puede utilizar para las siguientes tareas de visión artificial:

  • Object detection: es el proceso de identificar y localizar objetos dentro de una imagen. Se puede utilizar en aplicaciones como videovigilancia o coches autónomos.

  • Etiquetado de imágenes: Esta tarea implica generar un texto descriptivo para una imagen. Hace que el contenido visual sea más accesible y fácil de entender.

  • Optical character recognition: esta tecnología convierte el texto presente en las imágenes en texto editable y legible por máquina. Resulta útil para digitalizar documentos y automatizar la introducción de datos.

Evaluación comparativa y comparación de Google Gemini 2.5 con otros modelos#

Existen varios modelos multimodales disponibles en el ámbito de la IA hoy en día, por lo que es importante entender cómo se compara Gemini 2.5 Pro con ellos. Basándose en los resultados de las pruebas comparativas compartidos por DeepMind de Google, Gemini 2.5 Pro muestra un rendimiento impresionante en una variedad de tareas.

Por ejemplo, en una prueba llamada «Humanity’s Last Exam», que simula un examen desafiante que abarca muchas materias y pone a prueba el razonamiento avanzado y los conocimientos generales, Gemini 2.5 Pro obtiene alrededor de un 18,8%, superando a modelos como o3-mini de OpenAI, que obtiene alrededor de un 14%.

An overview of Gemini 2.5 Pro's benchmark performance

Fig 2. Resumen del rendimiento de referencia de Gemini 2.5 Pro.

También funciona muy bien en desafíos de matemáticas y programación, igualando o superando a menudo el rendimiento de modelos como OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta y DeepSeek R1, lo que demuestra su capacidad para manejar tareas complejas y procesar grandes volúmenes de datos.

Familiarízate con Gemini 2.5: Cómo usar la API de Google Gemini#

Gemini 2.5 Pro está disponible en múltiples plataformas. Puedes experimentar con él en Google AI Studio y acceder a él a través de la aplicación Gemini para usuarios de Gemini Advanced. En su anuncio de lanzamiento, Google DeepMind también mencionó que el modelo será compatible con Vertex AI pronto. Estos puntos de acceso facilitan a los desarrolladores el uso de Gemini 2.5 Pro para aplicaciones de IA del mundo real.

Sin embargo, si quieres utilizar la API de Google Gemini y empezar en pocos minutos sin configuraciones complicadas, y buscas comprender mejor sus capacidades de visión por computadora, puedes echar un vistazo al Ultralytics notebook que muestra tareas como la detección de objetos y el subtitulado de imágenes usando Gemini 2.5 Pro. Veamos en detalle qué puedes esperar del notebook.

Configuración de la inferencia con el notebook de Google Gemini 2.5#

Para empezar con el notebook de Ultralytics y usar Google Gemini 2.5, primero necesitas generar una clave de API a través de Google AI Studio. Esta clave te da acceso a la API de Gemini para que puedas usar el modelo.

Una vez que tengas tu clave de API, asegúrate de que tu entorno tenga instaladas las bibliotecas necesarias; esto incluye paquetes de Ultralytics y el kit de herramientas de IA de Google. Este paso se explica claramente en el notebook, por lo que puedes seguir fácilmente las instrucciones para configurar tu espacio de trabajo.

Con todo configurado, puedes conectarte a la API de Gemini introduciendo tu clave de API (como se muestra a continuación), lo que crea un enlace entre tu espacio de trabajo y el modelo. Después de eso, estarás listo para enviar imágenes y prompts de texto a Gemini 2.5.

Esencialmente, puedes proporcionar una imagen y una instrucción simple (como «detecta objetos en esta imagen» o «describe lo que ves») al modelo, y este devuelve los resultados que necesitas. Este proceso directo facilita el inicio en la exploración de las capacidades de visión artificial de Gemini 2.5.

Detección de objetos con Google Gemini 2.5#

Uno de los ejemplos clave en el notebook es la detección de objetos usando Gemini 2.5 Pro. En este ejemplo, proporcionas al modelo una imagen y un prompt sencillo para detectar objetos.

El modelo procesa la imagen y devuelve un conjunto de coordenadas y etiquetas para cada objeto que encuentra; estas coordenadas se proporcionan en forma normalizada. A continuación, se utilizan funciones del Ultralytics Python package para convertir estos valores normalizados a las dimensiones reales de la imagen y dibujar cuadros delimitadores claros alrededor de cada objeto, tal como se muestra a continuación.

Using Google Gemini 2.5 for object detection

Fig 3. Uso de Google Gemini 2.5 para la detección de objetos.

Etiquetado de imágenes usando Gemini 2.5#

Otro ejemplo interesante en el notebook es el image captioning utilizando Gemini 2.5 Pro. En este ejemplo, le proporcionas al modelo una imagen y un mensaje (prompt) pidiéndole que genere un título detallado que describa lo que aparece en la imagen.

El modelo luego analiza el contenido visual y devuelve una narrativa, a menudo formateada como varias frases, que captura tanto el contenido como el contexto de la imagen. Esta función es útil para mejorar la accesibilidad, resumir información visual e incluso mejorar la narrativa creativa.

Mejora de la precisión del OCR con modelos de Google Gemini#

Una tarea de visión artificial que utiliza la capacidad de Gemini 2.5 Pro para leer texto en imágenes es el OCR. En el notebook, puedes proporcionar al modelo una imagen que contenga texto junto con un prompt para extraer ese texto. El modelo procesa la imagen y devuelve tanto el texto detectado como las coordenadas donde se encuentra el texto, como se muestra a continuación.

Las funciones del paquete de Python de Ultralytics se utilizan después para convertir estas coordenadas normalizadas en las dimensiones reales de la imagen y dibujar bounding boxes alrededor de las regiones de texto. Este resultado anotado deja clara la ubicación del texto, lo cual es útil para digitalizar documentos, automatizar la entrada de datos y mejorar la accesibilidad.

Extracting textual data in an image using Google Gemini 2.5

Fig 4. Extracción de datos textuales en una imagen usando Google Gemini 2.5.

Aplicaciones del mundo real de Google Gemini 2.5#

Ahora que hemos visto cómo se puede usar Google Gemini 2.5 Pro para varias tareas de visión artificial, exploremos algunas aplicaciones del mundo real donde se pueden usar estas capacidades.

La capacidad de detección de objetos de Gemini 2.5 Pro, por ejemplo, puede ayudar a etiquetar y organizar automáticamente grandes conjuntos de imágenes, haciendo que tareas como la creación de dataset o la gestión de contenidos sean mucho más rápidas. También se puede usar para analizar imágenes en campos como el comercio minorista y la agricultura; por ejemplo, detectando productos en estantes o identificando signos de estrés en cultivos a partir de fotos de granjas.

Gemini 2.5 Pro analyzing a plant's health

Fig 5. Gemini 2.5 Pro analizando la salud de una planta.

Mientras tanto, la función de etiquetado de imágenes del modelo puede ayudar a los usuarios con discapacidad visual a entender lo que hay en una imagen. Por ejemplo, si tienes una foto de una calle concurrida, el modelo podría producir un pie de foto que describa la escena en detalle, mencionando los tipos de vehículos, la actividad de los peatones e incluso la hora del día según las señales de iluminación.

Además de esto, la funcionalidad de OCR de Gemini 2.5 se puede utilizar en una variedad de aplicaciones. Por ejemplo, puedes digitalizar documentos impresos escaneando páginas o recibos. Esta capacidad es ideal para automatizar tareas de entrada de datos, procesar formularios o incluso leer texto de tarjetas de visita y señalización.

En general, Google Gemini 2.5 Pro abre las puertas a una amplia gama de aplicaciones prácticas de IA.

Conclusiones clave#

Más allá de generar y analizar texto, Google Gemini 2.5 Pro puede utilizarse para tareas de visión artificial como la detección de objetos, el etiquetado de imágenes y OCR. Con su enorme ventana de contexto y capacidades de razonamiento mejoradas, produce resultados detallados y conscientes del contexto que funcionan bien en escenarios del mundo real.

A medida que los modelos de IA siguen evolucionando, herramientas como Gemini 2.5 Pro facilitan la resolución de problemas complejos en todas las industrias. Es probable que veamos una adopción aún más amplia de la IA a medida que más organizaciones busquen soluciones flexibles y multimodales que puedan manejar una amplia gama de tareas, desde la comprensión visual hasta el procesamiento del lenguaje.

Forma parte de our community y descubre proyectos de IA de vanguardia en nuestro GitHub repository. Consulta las aplicaciones de Vision AI in agriculture y el papel de AI in manufacturing en nuestras páginas de soluciones. ¡Explora our licensing plans y construye soluciones de visión por computadora hoy mismo!

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático