Multimodal RAG
Explora RAG multimodal para procesar texto, imágenes y vídeo. Descubre cómo Ultralytics YOLO26 mejora las canalizaciones de recuperación de IA para ofrecer respuestas más precisas y conscientes del contexto.
La generación aumentada mediante recuperación multimodal (Multimodal RAG) es un marco avanzado de inteligencia artificial (AI) que amplía los sistemas RAG tradicionales para procesar y razonar con diversos tipos de datos, como texto, imágenes, vídeo y audio. Mientras que la generación aumentada mediante recuperación (RAG) estándar mejora la precisión de un modelo de lenguaje grande (LLM) al recuperar documentos textuales relevantes, Multimodal RAG permite que los modelos «vean» y «oigan» al recuperar contexto de una base de conocimiento multimedia. Este enfoque fundamenta la generación del modelo en evidencias visuales o auditivas concretas, lo que reduce significativamente las alucinaciones en los LLM y permite realizar tareas complejas, como responder preguntas visuales sobre conjuntos de datos privados. Al aprovechar el aprendizaje multimodal, estos sistemas pueden sintetizar información de la consulta de un usuario (p. ej., texto) y de los recursos recuperados (p. ej., un diagrama o un fotograma de vigilancia) para producir respuestas exhaustivas y conscientes del contexto.
Cómo funciona Multimodal RAG#
La arquitectura de un sistema Multimodal RAG suele reflejar la canalización estándar de «recuperar y generar», pero adaptada a datos no textuales. Este proceso depende en gran medida de las bases de datos vectoriales y de espacios semánticos compartidos.
-
Indexación: Se procesan datos de diversas fuentes —PDF, vídeos y presentaciones—. Los modelos de extracción de características convierten estas distintas modalidades en vectores numéricos de alta dimensionalidad conocidos como embeddings. Por ejemplo, un modelo como CLIP de OpenAI alinea los embeddings de imágenes y texto para que una imagen de un perro y la palabra «perro» estén matemáticamente próximos.
-
Recuperación: Cuando un usuario formula una pregunta (p. ej., «Muéstrame el defecto de esta placa de circuito»), el sistema realiza una búsqueda semántica en la base de datos vectorial para encontrar las imágenes o los clips de vídeo más relevantes que coincidan con la intención de la consulta.
-
Generación: El contexto visual recuperado se introduce en un modelo de visión y lenguaje (VLM). El VLM procesa tanto el mensaje de texto del usuario como las características de la imagen recuperada para generar una respuesta final, como si «conversara» con los datos.
Aplicaciones en el mundo real#
Multimodal RAG está transformando las industrias al permitir que los agentes de AI interactúen con el mundo físico mediante datos visuales.
- Mantenimiento industrial y fabricación: En la AI en la fabricación, los técnicos pueden consultar un sistema con una foto de una pieza de máquina averiada. El sistema Multimodal RAG recupera registros históricos de mantenimiento similares, esquemas técnicos y tutoriales en vídeo para guiar el proceso de reparación. Esto reduce el tiempo de inactividad y democratiza el conocimiento experto.
- Descubrimiento en el comercio minorista y el comercio electrónico: Las aplicaciones que utilizan AI en el comercio minorista permiten a los clientes subir una imagen de un conjunto de ropa que les gusta. El sistema recupera artículos visualmente similares del inventario actual y genera recomendaciones de estilo o comparaciones de productos, creando una experiencia de compra altamente personalizada.
Diferenciación entre términos relacionados#
Para entender el nicho específico de Multimodal RAG, resulta útil distinguirlo de conceptos relacionados:
- Multimodal RAG frente a modelo multimodal: Un modelo multimodal (como GPT-4o o Gemini) crea la respuesta. Multimodal RAG es la arquitectura que proporciona a ese modelo datos externos y privados (imágenes y documentos) con los que no se entrenó. El modelo es el motor; RAG es la línea de combustible.
- Multimodal RAG frente al ajuste fino: El ajuste fino actualiza permanentemente los pesos del modelo para aprender una tarea o un estilo nuevos. RAG proporciona conocimiento temporal durante la inferencia. RAG es la opción preferida para datos dinámicos (p. ej., el inventario diario), cuando volver a entrenar con frecuencia no resulta práctico.
Implementación con Ultralytics#
Los desarrolladores pueden crear el componente de recuperación de una canalización Multimodal RAG mediante Ultralytics YOLO. Al detectar y clasificar objetos dentro de las imágenes, YOLO proporciona metadatos estructurados que se pueden indexar para la recuperación basada en texto o utilizar para recortar regiones de imagen relevantes para un VLM. La Ultralytics Platform simplifica el entrenamiento de estos modelos de visión especializados para reconocer objetos personalizados esenciales para tu ámbito específico.
El siguiente ejemplo muestra cómo utilizar YOLO26 para extraer contexto visual (objetos detectados) de una imagen, que después podría pasarse a un LLM como parte de un flujo de trabajo RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personLecturas y recursos adicionales#
- Documentación de LangChain: Una guía completa para crear canalizaciones de recuperación, incluida la compatibilidad multimodal.
- Guía multimodal de LlamaIndex: Documentación detallada sobre la indexación y recuperación de tipos de datos complejos para LLM.
- Google Cloud Vertex AI Search: Funcionalidades de búsqueda vectorial de nivel empresarial para crear aplicaciones RAG escalables.
- Soluciones de Ultralytics: Descubre cómo la visión por ordenador se integra con sistemas de AI más amplios en diversos sectores.









