YOLO Vision 2026:
Volver al glosario de Ultralytics

Vision Language Model (VLM)

Explora los modelos de lenguaje visual (VLM) con Ultralytics. Aprende cómo combinan la visión artificial y los LLM para VQA y la detección de vocabulario abierto usando Ultralytics YOLO26.

Un Vision Language Model (VLM) es un tipo de inteligencia artificial capaz de procesar e interpretar información visual (imágenes o vídeo) e información textual de forma simultánea. A diferencia de los modelos tradicionales de computer vision, que se centran únicamente en datos de píxeles, o los Large Language Models (LLMs), que solo entienden texto, los VLM sirven de puente entre estas dos modalidades. Al entrenarse con conjuntos de datos masivos que contienen pares de imagen y texto, estos modelos aprenden a asociar características visuales con conceptos lingüísticos, lo que les permite describir imágenes, responder preguntas sobre escenas visuales e incluso ejecutar órdenes basándose en lo que "ven".

Cómo funcionan los modelos de lenguaje visual#

En su núcleo, los VLM constan normalmente de dos componentes principales: un codificador de visión y un codificador de texto. El codificador de visión procesa las imágenes para extraer feature maps y representaciones visuales, mientras que el codificador de texto gestiona la entrada lingüística. Estos flujos de datos diferenciados se fusionan posteriormente mediante mecanismos como la cross-attention para alinear la información visual y textual en un espacio de incrustación compartido.

Los recientes avances de 2024 y 2025 han evolucionado hacia arquitecturas más unificadas donde una única estructura de Transformer se encarga de ambas modalidades. Por ejemplo, modelos como Google PaliGemma 2 demuestran cómo la integración eficaz de estos flujos puede mejorar el rendimiento en tareas de razonamiento complejas. Esta alineación permite al modelo comprender el contexto, como reconocer que la palabra "manzana" se refiere a una fruta en la imagen de un supermercado pero a una empresa tecnológica en un logotipo.

Aplicaciones en el mundo real#

La capacidad de comprender el mundo a través de la vista y el lenguaje abre diversas aplicaciones en varios sectores:

  • Visual Question Answering (VQA): Los VLM se utilizan ampliamente en healthcare diagnostics para asistir a los radiólogos. Un médico puede preguntar a un sistema: "¿Hay alguna fractura en esta radiografía?", y el modelo analiza la imagen médica para ofrecer una valoración preliminar, lo que reduce los errores de diagnóstico.
  • Smart E-Commerce Search: En retail environments, los VLM permiten a los usuarios buscar productos mediante descripciones en lenguaje natural combinadas con imágenes. Un comprador puede subir una foto del conjunto de una celebridad y pedir: "Encuéntrame un vestido con este estampado pero en azul", y el sistema utiliza la semantic search para recuperar coincidencias exactas.
  • Automatización de subtítulos y accesibilidad: Los VLM generan automáticamente alt text descriptivo para imágenes en la web, lo que hace que el contenido digital sea más accesible para usuarios con discapacidad visual que dependen de lectores de pantalla.

Diferenciación de los VLM de conceptos relacionados#

Resulta útil distinguir los VLM de otras categorías de IA para comprender su papel específico:

  • VLM vs. LLM: Un Large Language Model (como las versiones de texto de GPT-4) procesa únicamente datos de texto. Aunque puede generar historias creativas o código, no puede "ver" una imagen. Un VLM dota efectivamente de ojos a un LLM.
  • VLM vs. Object Detection: Los modelos de object detection tradicionales, como las primeras versiones de YOLO, identifican dónde están los objetos y a qué clase pertenecen (por ejemplo, "Coche: 99%"). Un VLM va más allá al comprender las relaciones y los atributos, como "un coche deportivo rojo aparcado junto a una boca de incendios".
  • VLM vs. Multimodal AI: Multimodal AI es un término general más amplio. Aunque todos los VLM son multimodales (combinan visión y lenguaje), no todos los modelos multimodales son VLM; algunos pueden combinar audio y texto (como la conversión de voz a texto) o vídeo y datos de sensores sin un componente de lenguaje.

Detección de vocabulario abierto con YOLO#

Los VLM modernos permiten la detección de vocabulario abierto, donde puedes detectar objetos utilizando mensajes de texto de forma libre en lugar de clases predefinidas. Esta es una característica clave de modelos como Ultralytics YOLO-World, que permite definir clases de forma dinámica sin necesidad de reentrenamiento.

El siguiente ejemplo demuestra cómo utilizar el paquete ultralytics para detectar objetos específicos descritos mediante texto:

from ultralytics import YOLOWorld

# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Desafíos y direcciones futuras#

A pesar de su potencia, los Vision Language Models se enfrentan a desafíos importantes. Un problema destacado es la hallucination, donde el modelo describe con seguridad objetos o texto en una imagen que simplemente no están ahí. Los investigadores trabajan activamente en técnicas como el Reinforcement Learning from Human Feedback (RLHF) para mejorar la fiabilidad y la precisión.

Otro reto es el coste computacional. Entrenar estos modelos masivos requiere cuantiosos GPU resources. Sin embargo, el lanzamiento de arquitecturas eficientes como Ultralytics YOLO26 está ayudando a llevar capacidades de visión avanzadas a dispositivos de borde. A medida que avanzamos, esperamos ver a los VLM desempeñando un papel crucial en los robotic agents, permitiendo a los robots navegar y manipular objetos basándose en instrucciones verbales complejas.

Para quienes estén interesados en los fundamentos teóricos, el CLIP paper by OpenAI original aporta una excelente perspectiva sobre el preentrenamiento contrastivo de imagen y lenguaje. Asimismo, estar al día de los CVPR conference papers resulta fundamental para seguir la rápida evolución de estas arquitecturas. Para experimentar entrenando tus propios modelos de visión, puedes utilizar la Ultralytics Platform para optimizar la gestión de conjuntos de datos y el despliegue de modelos.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático