YOLO Vision 2026:
Volver al glosario de Ultralytics

Image Captioning

Aprende cómo el subtitulado de imágenes utiliza modelos de visión y lenguaje para generar descripciones de imágenes, explora aplicaciones del mundo real y fundamenta los subtítulos con Ultralytics YOLO26.

La generación de subtítulos de imágenes es una tarea de IA que genera automáticamente una descripción en lenguaje natural de una imagen. Por ejemplo, ante la foto de una calle, un sistema podría producir: "Un autobús urbano pasa junto a peatones en un cruce". La tarea combina la percepción visual con la generación de lenguaje, por lo que el modelo debe identificar contenido importante, comprender las relaciones entre los objetos y expresar esa información con claridad.

La subtitulación la realiza habitualmente un modelo de visión-lenguaje, que opera con datos visuales y textuales. A diferencia de un pie de foto escrito manualmente, un subtítulo generado por IA es una predicción basada en patrones aprendidos a partir de pares de imagen y texto.

Cómo funciona la generación de subtítulos de imágenes#

Un sistema de generación de subtítulos de imágenes suele constar de dos etapas conectadas:

  1. Un codificador de visión convierte los píxeles en representaciones de características que describen objetos, texturas, ubicaciones e información más amplia de la escena.
  2. Un decodificador de lenguaje transforma esas características visuales en una secuencia de palabras.

Muchos sistemas utilizan un decodificador con Transformer. Comienza con un token de inicio, predice el siguiente token, lo añade a la secuencia y repite el proceso hasta generar un token de fin o alcanzar un límite de longitud. El glosario de aprendizaje automático de Google describe este proceso token por token como generación autorregresiva.

Un mecanismo de atención ayuda al decodificador a centrarse en las regiones relevantes de la imagen mientras selecciona cada palabra. Al generar "autobús", puede destacar el vehículo; al generar "calle", puede atender a la carretera circundante. El tutorial de generación de subtítulos de imágenes de TensorFlow muestra cómo se combinan las características de las imágenes, la tokenización, la atención cruzada y un decodificador de texto.

El entrenamiento requiere por lo general imágenes asociadas a uno o más subtítulos escritos por humanos. Disponer de múltiples subtítulos es útil porque una misma imagen se puede describir correctamente de distintas maneras, como "Un niño jugando con un perro" y "Una persona joven lanza una pelota para una mascota".

Diferencias con tareas de visión relacionadas#

La generación de subtítulos de imágenes se solapa con varias tareas de IA, pero produce un resultado diferenciado:

  • La clasificación de imágenes asigna una o más etiquetas a toda la imagen, como "playa". La subtitulación genera una oración que puede describir objetos, acciones, atributos y contexto.
  • La detección de objetos identifica y localiza objetos predefinidos con cuadros delimitadores. La subtitulación puede mencionar dichos objetos, pero también describe sus relaciones, como "Dos ciclistas montando en bicicleta junto a un coche".
  • El reconocimiento óptico de caracteres extrae escritura visible de carteles, documentos o envases. Un subtítulo resume la escena en lugar de transcribir todo el texto.
  • La respuesta visual a preguntas responde a una pregunta específica sobre una imagen. La subtitulación crea una descripción general sin requerir ninguna pregunta.
  • El texto alternativo comunica el propósito de una imagen en un contexto particular. Un subtítulo automatizado puede proporcionar un borrador, pero no es automáticamente un texto alternativo adecuado, ya que las imágenes decorativas, funcionales y complejas requieren un tratamiento diferente según el tutorial de imágenes de W3C.

Aplicaciones en el mundo real#

  • Contenido web accesible: una plataforma de publicación puede generar borradores de descripciones para fotografías recién subidas. Para la imagen de una noticia, el subtítulo podría identificar a las personas principales, el escenario y la acción antes de que un editor verifique su precisión y relevancia. Los diagramas complejos siguen necesitando una descripción larga estructurada en lugar de un resumen visual genérico.

  • Bibliotecas de medios con capacidad de búsqueda: un minorista o una empresa de medios puede poner subtítulos a grandes colecciones de imágenes e indexar el texto generado. Los usuarios pueden buscar frases como "mochila roja al lado de una tienda de campaña" incluso cuando los archivos nunca se hayan etiquetado manualmente. Los subtítulos pueden complementar las incrustaciones visuales y los metadatos, mejorando el descubrimiento en catálogos extensos.

Fundamentación práctica con Ultralytics YOLO#

Los generadores de subtítulos pueden inventar detalles no respaldados, en particular en escenas concurridas o poco familiares. Un diseño práctico consiste en fundamentar la generación con observaciones estructuradas de Ultralytics YOLO26. El siguiente flujo de trabajo de predicción de YOLO documentado extrae los nombres de los objetos detectados que un componente de lenguaje posterior puede utilizar como contexto visual:

from ultralytics import YOLO

# Detect objects that can ground a downstream caption generator
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact textual context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

Este flujo de trabajo no produce el subtítulo final. En su lugar, proporciona etiquetas de objetos verificables que pueden acotar un modelo de lenguaje. Para dominios personalizados, la Ultralytics Platform admite la anotación de conjuntos de datos en la nube, el entrenamiento, el despliegue y la supervisión para el componente de percepción de una canalización de subtitulación.

Limitaciones y evaluación#

Los subtítulos pueden omitir objetos importantes, confundir relaciones, reproducir sesgos del conjunto de datos o alucinar detalles que no son visibles. Las puntuaciones de confianza pueden ayudar a clasificar las descripciones candidatas, como ilustra la API de descripción de imágenes de Azure, pero una oración fluida no es necesariamente verídica.

Por lo tanto, la evaluación debe examinar la cobertura de objetos, la fundamentación fáctica, la legibilidad, el sesgo y la utilidad para el público al que va dirigida. Dado que varios subtítulos pueden ser igualmente correctos, los equipos deben combinar mediciones automatizadas con la revisión humana, siguiendo prácticas como la evaluación de IA generativa y el marco de gestión de riesgos de IA del NIST más amplio. La aprobación humana sigue siendo especialmente importante para contenidos de accesibilidad, médicos, críticos para la seguridad o de cara al público.

Explore solutions

Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático