YOLO Vision 2026:
Volver al glosario de Ultralytics

Multimodal RAG

Explora RAG multimodal para procesar texto, imágenes y vídeo. Aprende cómo Ultralytics YOLO26 mejora las tuberías de recuperación de IA para obtener respuestas más precisas y conscientes del contexto.

Multimodal Retrieval Augmented Generation (Multimodal RAG) es un marco de intelligence artificial (AI) avanzado que amplía los sistemas RAG tradicionales para procesar y razonar a través de diversos tipos de datos, como texto, imágenes, vídeo y audio. Aunque el Retrieval Augmented Generation (RAG) estándar mejora la precisión de un Large Language Model (LLM) al recuperar documentos textuales relevantes, Multimodal RAG permite a los modelos "ver" y "oír" recuperando contexto de una base de conocimiento de medios mixtos. Este enfoque fundamenta la generación del modelo en pruebas visuales o auditivas concretas, lo que reduce significativamente las alucinaciones en LLMs y permite realizar tareas complejas como la respuesta visual a preguntas sobre conjuntos de datos privados. Al aprovechar el aprendizaje multimodal, estos sistemas pueden sintetizar información a partir de la consulta de un usuario (por ejemplo, texto) y activos recuperados (por ejemplo, un diagrama o un fotograma de vigilancia) para producir respuestas completas y conscientes del contexto.

Cómo funciona el RAG multimodal#

La arquitectura de un sistema Multimodal RAG suele reflejar la canalización estándar "Retrieve-then-Generate" (Recuperar y luego Generar), pero la adapta para datos no textuales. Este proceso depende en gran medida de las bases de datos vectoriales y los espacios semánticos compartidos.

  1. Indexación: Se procesan datos de diversas fuentes (PDF, vídeos, presentaciones). Los modelos de extracción de características convierten estas diferentes modalidades en vectores numéricos de alta dimensión conocidos como incrustaciones (embeddings). Por ejemplo, un modelo como CLIP de OpenAI alinea las incrustaciones de imágenes y textos para que la foto de un perro y la palabra "perro" estén matemáticamente cerca.

  2. Recuperación: Cuando un usuario plantea una pregunta (por ejemplo, "Muéstrame el defecto en esta placa de circuito"), el sistema realiza una búsqueda semántica en la base de datos vectorial para encontrar las imágenes o los clips de vídeo más relevantes que coincidan con la intención de la consulta.

  3. Generación: El contexto visual recuperado se introduce en un Vision-Language Model (VLM). El VLM procesa tanto la indicación de texto del usuario como las características de la imagen recuperada para generar una respuesta final, "chateando" eficazmente con los datos.

Aplicaciones en el mundo real#

Multimodal RAG está transformando las industrias al permitir que los agentes de IA interactúen con el mundo físico a través de datos visuales.

  • Mantenimiento industrial y fabricación: En la IA en la fabricación, los técnicos pueden consultar un sistema con una foto de una pieza de máquina rota. El sistema Multimodal RAG recupera registros de mantenimiento históricos similares, esquemas técnicos y tutoriales en vídeo para guiar el proceso de reparación. Esto reduce el tiempo de inactividad y democratiza el conocimiento experto.
  • Descubrimiento minorista y de comercio electrónico: Las aplicaciones que utilizan IA en el comercio minorista permiten a los clientes subir una imagen de un conjunto que les gusta. El sistema recupera artículos visualmente similares del inventario actual y genera consejos de estilo o comparaciones de productos, lo que crea una experiencia de compra altamente personalizada.

Diferenciación de términos relacionados#

Para entender el nicho específico del RAG multimodal, resulta útil distinguirlo de conceptos relacionados:

  • Multimodal RAG frente a Modelo Multimodal: Un modelo multimodal (como GPT-4o o Gemini) crea la respuesta. Multimodal RAG es la arquitectura que alimenta a ese modelo con datos externos y privados (imágenes, documentos) con los que no fue entrenado. El modelo es el motor; RAG es la línea de combustible.
  • Multimodal RAG frente a Ajuste fino: El ajuste fino actualiza permanentemente los pesos del modelo para aprender una nueva tarea o estilo. RAG proporciona conocimiento temporal en el momento de la inferencia. RAG se prefiere para datos dinámicos (por ejemplo, inventario diario) donde el reentrenamiento frecuente no es práctico.

Implementación con Ultralytics#

Los desarrolladores pueden construir el componente de recuperación de una canalización Multimodal RAG utilizando Ultralytics YOLO. Al detectar y clasificar objetos dentro de las imágenes, YOLO proporciona metadatos estructurados que se pueden indexar para la recuperación basada en texto o utilizar para recortar regiones de imagen relevantes para un VLM. La Plataforma Ultralytics simplifica el entrenamiento de estos modelos de visión especializados para reconocer objetos personalizados cruciales para tu dominio específico.

El siguiente ejemplo demuestra el uso de YOLO26 para extraer contexto visual (objetos detectados) de una imagen, que luego podría pasarse a un LLM como parte de un flujo de trabajo RAG.

from ultralytics import YOLO

# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")

# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")

# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]

print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person

Lecturas adicionales y recursos#

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático