Vision Language Model (VLM)
Explora los modelos de lenguaje visual (VLM) con Ultralytics. Aprende cómo combinan la visión artificial y los LLM para VQA y la detección de vocabulario abierto usando Ultralytics YOLO26.
Un Vision Language Model (VLM) es un tipo de inteligencia artificial capaz de procesar e interpretar información visual (imágenes o vídeo) e información textual de forma simultánea. A diferencia de los modelos tradicionales de computer vision, que se centran únicamente en datos de píxeles, o los Large Language Models (LLMs), que solo entienden texto, los VLM sirven de puente entre estas dos modalidades. Al entrenarse con conjuntos de datos masivos que contienen pares de imagen y texto, estos modelos aprenden a asociar características visuales con conceptos lingüísticos, lo que les permite describir imágenes, responder preguntas sobre escenas visuales e incluso ejecutar órdenes basándose en lo que "ven".
Cómo funcionan los modelos de lenguaje visual#
En su núcleo, los VLM constan normalmente de dos componentes principales: un codificador de visión y un codificador de texto. El codificador de visión procesa las imágenes para extraer feature maps y representaciones visuales, mientras que el codificador de texto gestiona la entrada lingüística. Estos flujos de datos diferenciados se fusionan posteriormente mediante mecanismos como la cross-attention para alinear la información visual y textual en un espacio de incrustación compartido.
Los recientes avances de 2024 y 2025 han evolucionado hacia arquitecturas más unificadas donde una única estructura de Transformer se encarga de ambas modalidades. Por ejemplo, modelos como Google PaliGemma 2 demuestran cómo la integración eficaz de estos flujos puede mejorar el rendimiento en tareas de razonamiento complejas. Esta alineación permite al modelo comprender el contexto, como reconocer que la palabra "manzana" se refiere a una fruta en la imagen de un supermercado pero a una empresa tecnológica en un logotipo.
Aplicaciones en el mundo real#
La capacidad de comprender el mundo a través de la vista y el lenguaje abre diversas aplicaciones en varios sectores:
- Visual Question Answering (VQA): Los VLM se utilizan ampliamente en healthcare diagnostics para asistir a los radiólogos. Un médico puede preguntar a un sistema: "¿Hay alguna fractura en esta radiografía?", y el modelo analiza la imagen médica para ofrecer una valoración preliminar, lo que reduce los errores de diagnóstico.
- Smart E-Commerce Search: En retail environments, los VLM permiten a los usuarios buscar productos mediante descripciones en lenguaje natural combinadas con imágenes. Un comprador puede subir una foto del conjunto de una celebridad y pedir: "Encuéntrame un vestido con este estampado pero en azul", y el sistema utiliza la semantic search para recuperar coincidencias exactas.
- Automatización de subtítulos y accesibilidad: Los VLM generan automáticamente alt text descriptivo para imágenes en la web, lo que hace que el contenido digital sea más accesible para usuarios con discapacidad visual que dependen de lectores de pantalla.
Diferenciación de los VLM de conceptos relacionados#
Resulta útil distinguir los VLM de otras categorías de IA para comprender su papel específico:
- VLM vs. LLM: Un Large Language Model (como las versiones de texto de GPT-4) procesa únicamente datos de texto. Aunque puede generar historias creativas o código, no puede "ver" una imagen. Un VLM dota efectivamente de ojos a un LLM.
- VLM vs. Object Detection: Los modelos de object detection tradicionales, como las primeras versiones de YOLO, identifican dónde están los objetos y a qué clase pertenecen (por ejemplo, "Coche: 99%"). Un VLM va más allá al comprender las relaciones y los atributos, como "un coche deportivo rojo aparcado junto a una boca de incendios".
- VLM vs. Multimodal AI: Multimodal AI es un término general más amplio. Aunque todos los VLM son multimodales (combinan visión y lenguaje), no todos los modelos multimodales son VLM; algunos pueden combinar audio y texto (como la conversión de voz a texto) o vídeo y datos de sensores sin un componente de lenguaje.
Detección de vocabulario abierto con YOLO#
Los VLM modernos permiten la detección de vocabulario abierto, donde puedes detectar objetos utilizando mensajes de texto de forma libre en lugar de clases predefinidas. Esta es una característica clave de modelos como Ultralytics YOLO-World, que permite definir clases de forma dinámica sin necesidad de reentrenamiento.
El siguiente ejemplo demuestra cómo utilizar el paquete ultralytics para detectar objetos específicos descritos mediante texto:
from ultralytics import YOLOWorld
# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()Desafíos y direcciones futuras#
A pesar de su potencia, los Vision Language Models se enfrentan a desafíos importantes. Un problema destacado es la hallucination, donde el modelo describe con seguridad objetos o texto en una imagen que simplemente no están ahí. Los investigadores trabajan activamente en técnicas como el Reinforcement Learning from Human Feedback (RLHF) para mejorar la fiabilidad y la precisión.
Otro reto es el coste computacional. Entrenar estos modelos masivos requiere cuantiosos GPU resources. Sin embargo, el lanzamiento de arquitecturas eficientes como Ultralytics YOLO26 está ayudando a llevar capacidades de visión avanzadas a dispositivos de borde. A medida que avanzamos, esperamos ver a los VLM desempeñando un papel crucial en los robotic agents, permitiendo a los robots navegar y manipular objetos basándose en instrucciones verbales complejas.
Para quienes estén interesados en los fundamentos teóricos, el CLIP paper by OpenAI original aporta una excelente perspectiva sobre el preentrenamiento contrastivo de imagen y lenguaje. Asimismo, estar al día de los CVPR conference papers resulta fundamental para seguir la rápida evolución de estas arquitecturas. Para experimentar entrenando tus propios modelos de visión, puedes utilizar la Ultralytics Platform para optimizar la gestión de conjuntos de datos y el despliegue de modelos.






