Visual Instruction Tuning
Explora cómo el ajuste de instrucciones visuales permite a los modelos de lenguaje visual seguir directrices humanas. Aprende a construir flujos de trabajo de IA avanzados usando Ultralytics YOLO26.
El ajuste de instrucciones visuales es una técnica transformadora de aprendizaje automático que amplía los métodos tradicionales de procesamiento del lenguaje natural al dominio multimodal. Al entrenar un Vision Language Model (VLM) para que siga directrices humanas explícitas basadas en entradas de imagen o vídeo, los desarrolladores pueden crear asistentes de inteligencia artificial que comprenden y razonan sobre contenido visual. A diferencia de los modelos estándar de image classification que devuelven una categoría predefinida, el ajuste de instrucciones visuales capacita a los modelos para ejecutar tareas complejas y abiertas, como describir una escena, leer texto dentro de una imagen o responder preguntas específicas sobre relaciones espaciales. Esto acorta la distancia entre los large language models (LLMs) basados en texto y las canalizaciones tradicionales de computer vision.
Entender el concepto y las distinciones#
Para comprender el ajuste de instrucciones visuales, resulta útil distinguirlo de conceptos estrechamente relacionados en el ecosistema de la IA:
- Instruction Tuning: Suele referirse a la alineación de LLMs exclusivos de texto para que sigan la intención humana de forma segura y precisa. El ajuste de instrucciones visuales aplica esta misma metodología, pero incorpora imágenes en el mensaje (prompt) y en la salida esperada.
- Visual Prompting: Por lo general, implica interactuar con una inteligencia artificial mediante indicios visuales —como dibujar una caja delimitadora, colocar un punto o enmascarar un área en una imagen— para guiar el enfoque del modelo. En cambio, el ajuste de instrucciones visuales depende en gran medida de comandos en lenguaje natural combinados con los datos visuales.
El proceso de entrenamiento implica por lo general el fine-tuning de un modelo base multimodal preentrenado utilizando conjuntos de datos extensos formateados como tripletes de imagen, texto e instrucción. La investigación pionera en arXiv research on visual instruction tuning, como el proyecto LLaVA (Large Language-and-Vision Assistant), demostró que estos modelos pueden alcanzar notables capacidades de aprendizaje sin ejemplos (zero-shot). Hoy en día, las principales organizaciones de inteligencia artificial emplean esta técnica para impulsar modelos avanzados, incluidos OpenAI GPT-4o, Anthropic Claude 3.5 Sonnet y Google DeepMind Gemini.
Aplicaciones en el mundo real#
Al alinear las arquitecturas de multimodal deep learning con la intención humana, el ajuste de instrucciones visuales desbloquea aplicaciones altamente interactivas en diversas industrias:
- AI in Healthcare Diagnostics: Los profesionales médicos pueden utilizar modelos con instrucciones ajustadas para la Visual Question Answering (VQA). Un radiólogo puede consultar al sistema con una imagen de rayos X y la instrucción: "Resalta y explica cualquier signo de neumonía en el lóbulo inferior izquierdo", lo que permite que la inteligencia artificial actúe como un asistente de diagnóstico colaborativo.
- AI in Manufacturing Quality Control: En lugar de entrenar un modelo rígido de detección de defectos desde cero, los operadores pueden instruir a un sistema de visión como Microsoft Florence-2 indicando: "Identifica cualquier arañazo o abolladura microscópica en esta carcasa metálica recién fabricada".
Construir flujos de trabajo de visión#
Para construir sistemas que aprovechen estas capacidades, los desarrolladores suelen confiar en modelos sólidos de object detection para extraer el contexto estructural de las imágenes antes de pasar esos datos a un VLM. Mediante la documentación de PyTorch multi-modal documentation o los modelos de visión de TensorFlow vision models, los desarrolladores pueden crear canalizaciones híbridas.
Por ejemplo, puedes usar un modelo Ultralytics YOLO para percibir rápidamente una escena y generar un prompt de lenguaje informado para un VLM posterior:
from ultralytics import YOLO
# Load an Ultralytics YOLO26 model to extract visual context
model = YOLO("yolo26n.pt")
# Perform inference to identify objects for a downstream VLM prompt
results = model("https://ultralytics.com/images/bus.jpg")
# Extract object names to dynamically build an instruction prompt
objects = [model.names[int(cls)] for cls in results[0].boxes.cls]
prompt = f"Please provide a detailed safety analysis of the scene containing these objects: {', '.join(objects)}"
print(prompt)
# Output: Please provide a detailed safety analysis of the scene containing these objects: bus, person, person...Gestionar los complejos conjuntos de datos multimodales necesarios para estas aplicaciones de próxima generación puede ser un desafío. El Ultralytics Platform simplifica este proceso al proporcionar herramientas integrales para la anotación de conjuntos de datos, el entrenamiento en la nube y la implementación fluida de modelos. Ya sea que leas artículos de vanguardia en la biblioteca digital ACM digital library o en los archivos de visión por computador de IEEE Xplore computer vision, el cambio hacia sistemas de visión altamente capaces y ajustados mediante instrucciones representa la vanguardia de la inteligencia artificial. Al combinar la percepción de YOLO26 con modelos de razonamiento ajustados, las organizaciones pueden implementar agentes de inteligencia artificial increíblemente robustos.






