Ultralytics YOLO27:
Volver al glosario de Ultralytics

Vision Language Model (VLM)

Explora los modelos de visión y lenguaje (VLM) con Ultralytics. Aprende cómo conectan la visión artificial y los LLM para responder preguntas visuales (VQA) y detectar objetos con vocabulario abierto usando Ultralytics YOLO26.

Un modelo de visión y lenguaje (VLM) es un tipo de inteligencia artificial capaz de procesar e interpretar simultáneamente información visual (imágenes o vídeo) e información textual. A diferencia de los modelos tradicionales de visión artificial, que se centran exclusivamente en los datos de píxeles, o de los grandes modelos de lenguaje (LLM), que solo entienden texto, los VLM conectan estas dos modalidades. Al entrenarse con conjuntos de datos enormes que contienen pares de imagen y texto, estos modelos aprenden a asociar características visuales con conceptos lingüísticos, lo que les permite describir imágenes, responder preguntas sobre escenas visuales e incluso ejecutar comandos basándose en lo que «ven».

Cómo funcionan los modelos de visión y lenguaje#

En esencia, los VLM suelen constar de dos componentes principales: un codificador visual y un codificador de texto. El codificador visual procesa imágenes para extraer mapas de características y representaciones visuales, mientras que el codificador de texto se ocupa de la entrada lingüística. Después, estos flujos de datos distintos se fusionan mediante mecanismos como la atención cruzada, que alinea la información visual y textual en un espacio de incrustación compartido.

Los avances recientes de 2024 y 2025 se han orientado hacia arquitecturas más unificadas, en las que una sola estructura Transformer gestiona ambas modalidades. Por ejemplo, modelos como Google PaliGemma 2 muestran cómo una integración eficaz de estos flujos puede mejorar el rendimiento en tareas de razonamiento complejas. Esta alineación permite que el modelo entienda el contexto; por ejemplo, que la palabra «apple» hace referencia a una fruta en la imagen de una tienda de alimentación, pero a una empresa tecnológica en un logotipo.

Aplicaciones en el mundo real#

La capacidad de comprender el mundo mediante la vista y el lenguaje abre numerosas aplicaciones en diversos sectores:

  • Respuesta a preguntas visuales (VQA): Los VLM se utilizan ampliamente en el diagnóstico sanitario para ayudar a los radiólogos. Un médico podría preguntar al sistema «¿Hay una fractura en esta radiografía?» y el modelo analizaría la imagen médica para ofrecer una valoración preliminar y reducir los errores de diagnóstico.
  • Búsqueda inteligente en comercio electrónico: En los entornos minoristas, los VLM permiten buscar productos mediante descripciones en lenguaje natural combinadas con imágenes. Un comprador podría subir una foto del conjunto de ropa de una persona famosa y pedir «Encuéntrame un vestido con este estampado, pero azul»; el sistema utilizaría la búsqueda semántica para encontrar coincidencias precisas.
  • Generación automática de pies de foto y accesibilidad: Los VLM generan automáticamente texto alternativo descriptivo para las imágenes de la web, lo que hace que el contenido digital sea más accesible para las personas con discapacidad visual que utilizan lectores de pantalla.

Conviene distinguir los VLM de otras categorías de IA para comprender su función específica:

  • VLM frente a LLM: Un gran modelo de lenguaje (como las versiones de GPT-4 que solo procesan texto) procesa únicamente datos textuales. Aunque puede generar historias creativas o código, no puede «ver» una imagen. Un VLM, en la práctica, dota de ojos a un LLM.
  • VLM frente a detección de objetos: Los modelos tradicionales de detección de objetos, como las primeras versiones de YOLO, identifican dónde están los objetos y a qué clase pertenecen (por ejemplo, «Coche: 99 %»). Un VLM va más allá y entiende las relaciones y los atributos; por ejemplo, «un coche deportivo rojo aparcado junto a una boca de incendios».
  • VLM frente a IA multimodal: La IA multimodal es un término general más amplio. Aunque todos los VLM son multimodales (combinan visión y lenguaje), no todos los modelos multimodales son VLM; algunos pueden combinar audio y texto (como la conversión de voz a texto) o vídeo y datos de sensores sin incluir un componente lingüístico.

Detección de vocabulario abierto con YOLO#

Los VLM modernos permiten la detección de «vocabulario abierto», en la que puedes detectar objetos con indicaciones de texto libres en lugar de clases predefinidas. Esta es una característica clave de modelos como Ultralytics YOLO-World, que permite definir clases de forma dinámica sin volver a entrenar.

El siguiente ejemplo muestra cómo utilizar el paquete ultralytics para detectar objetos específicos descritos mediante texto:

from ultralytics import YOLOWorld

# Carga un modelo capaz de comprender la visión y el lenguaje
model = YOLOWorld("yolov8s-world.pt")

# Define clases personalizadas con indicaciones de texto en lenguaje natural
model.set_classes(["person wearing sunglasses", "red backpack"])

# Ejecuta la inferencia para encontrar en una imagen estos objetos definidos mediante texto
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Muestra los resultados de la detección
results[0].show()

Retos y perspectivas de futuro#

Aunque son potentes, los modelos de visión y lenguaje afrontan retos importantes. Uno de los principales es la alucinación, que se produce cuando el modelo describe con seguridad objetos o texto que en realidad no aparecen en la imagen. Los investigadores trabajan activamente en técnicas como el aprendizaje por refuerzo a partir de comentarios humanos (RLHF) para mejorar la fundamentación y la precisión.

Otro reto es el coste computacional. Entrenar estos modelos de gran tamaño requiere muchos recursos de GPU. Sin embargo, el lanzamiento de arquitecturas eficientes como Ultralytics YOLO26 está ayudando a llevar capacidades de visión avanzadas a los dispositivos periféricos. A medida que avancemos, esperamos que los VLMs desempeñen un papel crucial en los agentes robóticos, lo que permitirá a los robots desplazarse y manipular objetos basándose en instrucciones verbales complejas.

Si te interesan los fundamentos teóricos, el artículo original de CLIP de OpenAI ofrece información excelente sobre el preentrenamiento contrastivo de lenguaje e imágenes. Además, es esencial seguir los artículos de la conferencia CVPR para estar al día de la rápida evolución de estas arquitecturas. Para experimentar con el entrenamiento de tus propios modelos de visión, puedes utilizar la plataforma Ultralytics y simplificar la gestión de conjuntos de datos y la implementación de modelos.

Explore solutions

Visión artificial para imágenes aéreas

Visión artificial para imágenes aéreas

Convierte las imágenes de drones y las imágenes aéreas en información práctica en tiempo real para la agricultura, la acuicultura, la vigilancia medioambiental, la conservación y el análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en el sector aeroespacial

Visión artificial en el sector aeroespacial

Lleva la IA de visión a la supervisión aérea con los modelos Ultralytics YOLO. Impulsa drones, flujos de trabajo aeroespaciales, conservación medioambiental y sectores geoespaciales con soluciones de visión artificial.
Más información
Visión artificial en seguridad

Visión artificial en seguridad

Protege todas tus instalaciones con los modelos Ultralytics YOLO. La IA visual permite supervisar perímetros, detectar amenazas, reconocer matrículas y mejorar la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Potencia máquinas más inteligentes con los modelos Ultralytics YOLO. La IA visual en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Agiliza la logística con modelos Ultralytics YOLO. La IA visual permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad del almacén en tiempo real.
Más información
Visión artificial en el comercio minorista

Visión artificial en el comercio minorista

Reinventa el comercio minorista con modelos Ultralytics YOLO. La IA visual permite realizar el seguimiento del inventario, supervisar estanterías, gestionar colas y obtener información más útil sobre los clientes.
Más información
Visión artificial en el sector sanitario

Visión artificial en el sector sanitario

Desarrolla soluciones sanitarias con modelos Ultralytics YOLO. La IA visual en el sector sanitario permite acelerar el diagnóstico por imagen, mejorar los diagnósticos y supervisar a los pacientes.
Más información
Visión artificial en la fabricación

Visión artificial en la fabricación

Optimiza la fabricación con modelos Ultralytics YOLO. La IA visual mejora el control de calidad, la detección de defectos, el cumplimiento de las normas de uso de EPI y la automatización de las líneas de montaje.
Más información
Visión artificial en la automoción

Visión artificial en la automoción

Aplica la visión artificial al sector de la automoción con modelos Ultralytics YOLO. La IA visual mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para lograr carreteras más inteligentes.
Más información
Visión artificial en la agricultura

Visión artificial en la agricultura

Incorpora la IA de visión a la agricultura inteligente con modelos Ultralytics YOLO. Impulsa la monitorización de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas más abundantes e inteligentes.
Más información
Visión artificial para imágenes aéreas

Visión artificial para imágenes aéreas

Convierte las imágenes de drones y las imágenes aéreas en información práctica en tiempo real para la agricultura, la acuicultura, la vigilancia medioambiental, la conservación y el análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en el sector aeroespacial

Visión artificial en el sector aeroespacial

Lleva la IA de visión a la supervisión aérea con los modelos Ultralytics YOLO. Impulsa drones, flujos de trabajo aeroespaciales, conservación medioambiental y sectores geoespaciales con soluciones de visión artificial.
Más información
Visión artificial en seguridad

Visión artificial en seguridad

Protege todas tus instalaciones con los modelos Ultralytics YOLO. La IA visual permite supervisar perímetros, detectar amenazas, reconocer matrículas y mejorar la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Potencia máquinas más inteligentes con los modelos Ultralytics YOLO. La IA visual en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Agiliza la logística con modelos Ultralytics YOLO. La IA visual permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad del almacén en tiempo real.
Más información
Visión artificial en el comercio minorista

Visión artificial en el comercio minorista

Reinventa el comercio minorista con modelos Ultralytics YOLO. La IA visual permite realizar el seguimiento del inventario, supervisar estanterías, gestionar colas y obtener información más útil sobre los clientes.
Más información
Visión artificial en el sector sanitario

Visión artificial en el sector sanitario

Desarrolla soluciones sanitarias con modelos Ultralytics YOLO. La IA visual en el sector sanitario permite acelerar el diagnóstico por imagen, mejorar los diagnósticos y supervisar a los pacientes.
Más información
Visión artificial en la fabricación

Visión artificial en la fabricación

Optimiza la fabricación con modelos Ultralytics YOLO. La IA visual mejora el control de calidad, la detección de defectos, el cumplimiento de las normas de uso de EPI y la automatización de las líneas de montaje.
Más información
Visión artificial en la automoción

Visión artificial en la automoción

Aplica la visión artificial al sector de la automoción con modelos Ultralytics YOLO. La IA visual mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para lograr carreteras más inteligentes.
Más información
Visión artificial en la agricultura

Visión artificial en la agricultura

Incorpora la IA de visión a la agricultura inteligente con modelos Ultralytics YOLO. Impulsa la monitorización de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas más abundantes e inteligentes.
Más información
Visión artificial para imágenes aéreas

Visión artificial para imágenes aéreas

Convierte las imágenes de drones y las imágenes aéreas en información práctica en tiempo real para la agricultura, la acuicultura, la vigilancia medioambiental, la conservación y el análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en el sector aeroespacial

Visión artificial en el sector aeroespacial

Lleva la IA de visión a la supervisión aérea con los modelos Ultralytics YOLO. Impulsa drones, flujos de trabajo aeroespaciales, conservación medioambiental y sectores geoespaciales con soluciones de visión artificial.
Más información
Visión artificial en seguridad

Visión artificial en seguridad

Protege todas tus instalaciones con los modelos Ultralytics YOLO. La IA visual permite supervisar perímetros, detectar amenazas, reconocer matrículas y mejorar la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Potencia máquinas más inteligentes con los modelos Ultralytics YOLO. La IA visual en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Agiliza la logística con modelos Ultralytics YOLO. La IA visual permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad del almacén en tiempo real.
Más información
Visión artificial en el comercio minorista

Visión artificial en el comercio minorista

Reinventa el comercio minorista con modelos Ultralytics YOLO. La IA visual permite realizar el seguimiento del inventario, supervisar estanterías, gestionar colas y obtener información más útil sobre los clientes.
Más información
Visión artificial en el sector sanitario

Visión artificial en el sector sanitario

Desarrolla soluciones sanitarias con modelos Ultralytics YOLO. La IA visual en el sector sanitario permite acelerar el diagnóstico por imagen, mejorar los diagnósticos y supervisar a los pacientes.
Más información
Visión artificial en la fabricación

Visión artificial en la fabricación

Optimiza la fabricación con modelos Ultralytics YOLO. La IA visual mejora el control de calidad, la detección de defectos, el cumplimiento de las normas de uso de EPI y la automatización de las líneas de montaje.
Más información
Visión artificial en la automoción

Visión artificial en la automoción

Aplica la visión artificial al sector de la automoción con modelos Ultralytics YOLO. La IA visual mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para lograr carreteras más inteligentes.
Más información
Visión artificial en la agricultura

Visión artificial en la agricultura

Incorpora la IA de visión a la agricultura inteligente con modelos Ultralytics YOLO. Impulsa la monitorización de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas más abundantes e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Inicia tu recorrido hacia el futuro del aprendizaje automático