Multimodal RAG
Explora RAG multimodal para procesar texto, imágenes y vídeo. Aprende cómo Ultralytics YOLO26 mejora las tuberías de recuperación de IA para obtener respuestas más precisas y conscientes del contexto.
Multimodal Retrieval Augmented Generation (Multimodal RAG) es un marco de intelligence artificial (AI) avanzado que amplía los sistemas RAG tradicionales para procesar y razonar a través de diversos tipos de datos, como texto, imágenes, vídeo y audio. Aunque el Retrieval Augmented Generation (RAG) estándar mejora la precisión de un Large Language Model (LLM) al recuperar documentos textuales relevantes, Multimodal RAG permite a los modelos "ver" y "oír" recuperando contexto de una base de conocimiento de medios mixtos. Este enfoque fundamenta la generación del modelo en pruebas visuales o auditivas concretas, lo que reduce significativamente las alucinaciones en LLMs y permite realizar tareas complejas como la respuesta visual a preguntas sobre conjuntos de datos privados. Al aprovechar el aprendizaje multimodal, estos sistemas pueden sintetizar información a partir de la consulta de un usuario (por ejemplo, texto) y activos recuperados (por ejemplo, un diagrama o un fotograma de vigilancia) para producir respuestas completas y conscientes del contexto.
Cómo funciona el RAG multimodal#
La arquitectura de un sistema Multimodal RAG suele reflejar la canalización estándar "Retrieve-then-Generate" (Recuperar y luego Generar), pero la adapta para datos no textuales. Este proceso depende en gran medida de las bases de datos vectoriales y los espacios semánticos compartidos.
-
Indexación: Se procesan datos de diversas fuentes (PDF, vídeos, presentaciones). Los modelos de extracción de características convierten estas diferentes modalidades en vectores numéricos de alta dimensión conocidos como incrustaciones (embeddings). Por ejemplo, un modelo como CLIP de OpenAI alinea las incrustaciones de imágenes y textos para que la foto de un perro y la palabra "perro" estén matemáticamente cerca.
-
Recuperación: Cuando un usuario plantea una pregunta (por ejemplo, "Muéstrame el defecto en esta placa de circuito"), el sistema realiza una búsqueda semántica en la base de datos vectorial para encontrar las imágenes o los clips de vídeo más relevantes que coincidan con la intención de la consulta.
-
Generación: El contexto visual recuperado se introduce en un Vision-Language Model (VLM). El VLM procesa tanto la indicación de texto del usuario como las características de la imagen recuperada para generar una respuesta final, "chateando" eficazmente con los datos.
Aplicaciones en el mundo real#
Multimodal RAG está transformando las industrias al permitir que los agentes de IA interactúen con el mundo físico a través de datos visuales.
- Mantenimiento industrial y fabricación: En la IA en la fabricación, los técnicos pueden consultar un sistema con una foto de una pieza de máquina rota. El sistema Multimodal RAG recupera registros de mantenimiento históricos similares, esquemas técnicos y tutoriales en vídeo para guiar el proceso de reparación. Esto reduce el tiempo de inactividad y democratiza el conocimiento experto.
- Descubrimiento minorista y de comercio electrónico: Las aplicaciones que utilizan IA en el comercio minorista permiten a los clientes subir una imagen de un conjunto que les gusta. El sistema recupera artículos visualmente similares del inventario actual y genera consejos de estilo o comparaciones de productos, lo que crea una experiencia de compra altamente personalizada.
Diferenciación de términos relacionados#
Para entender el nicho específico del RAG multimodal, resulta útil distinguirlo de conceptos relacionados:
- Multimodal RAG frente a Modelo Multimodal: Un modelo multimodal (como GPT-4o o Gemini) crea la respuesta. Multimodal RAG es la arquitectura que alimenta a ese modelo con datos externos y privados (imágenes, documentos) con los que no fue entrenado. El modelo es el motor; RAG es la línea de combustible.
- Multimodal RAG frente a Ajuste fino: El ajuste fino actualiza permanentemente los pesos del modelo para aprender una nueva tarea o estilo. RAG proporciona conocimiento temporal en el momento de la inferencia. RAG se prefiere para datos dinámicos (por ejemplo, inventario diario) donde el reentrenamiento frecuente no es práctico.
Implementación con Ultralytics#
Los desarrolladores pueden construir el componente de recuperación de una canalización Multimodal RAG utilizando Ultralytics YOLO. Al detectar y clasificar objetos dentro de las imágenes, YOLO proporciona metadatos estructurados que se pueden indexar para la recuperación basada en texto o utilizar para recortar regiones de imagen relevantes para un VLM. La Plataforma Ultralytics simplifica el entrenamiento de estos modelos de visión especializados para reconocer objetos personalizados cruciales para tu dominio específico.
El siguiente ejemplo demuestra el uso de YOLO26 para extraer contexto visual (objetos detectados) de una imagen, que luego podría pasarse a un LLM como parte de un flujo de trabajo RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personLecturas adicionales y recursos#
- Documentación de LangChain: Una guía completa para la construcción de canalizaciones de recuperación, incluido el soporte multimodal.
- Guía Multimodal de LlamaIndex: Documentación detallada sobre la indexación y recuperación de tipos de datos complejos para LLMs.
- Google Cloud Vertex AI Search: Capacidades de búsqueda vectorial de nivel empresarial para crear aplicaciones RAG escalables.
- Soluciones de Ultralytics: Explora cómo la visión artificial se integra con sistemas de IA más amplios en diversas industrias.






