Multimodal RAG
Explore le RAG multimodal pour traiter le texte, les images et la vidéo. Découvre comment Ultralytics YOLO26 améliore les pipelines de recherche d’informations de l’IA pour fournir des réponses plus précises et contextuelles.
La génération augmentée par récupération multimodale (RAG multimodal) est un framework avancé d’intelligence artificielle (AI) qui étend les systèmes RAG traditionnels afin de traiter et de raisonner sur divers types de données, comme le texte, les images, la vidéo et l’audio. Alors que la génération augmentée par récupération (RAG) standard améliore la précision d’un grand modèle de langage (LLM) en récupérant des documents textuels pertinents, le RAG multimodal permet aux modèles de « voir » et d’« entendre » en récupérant du contexte à partir d’une base de connaissances multimédia. Cette approche ancre la génération du modèle dans des éléments concrets de preuve visuelle ou auditive, ce qui réduit considérablement les hallucinations des LLM et permet d’effectuer des tâches complexes comme la réponse à des questions visuelles sur des jeux de données privés. En exploitant l’apprentissage multimodal, ces systèmes peuvent synthétiser les informations de la requête d’un utilisateur (p. ex. du texte) et des ressources récupérées (p. ex. un diagramme ou une image de surveillance) afin de produire des réponses complètes et tenant compte du contexte.
Fonctionnement du RAG multimodal#
L’architecture d’un système de RAG multimodal reprend généralement le pipeline standard « Retrieve-then-Generate », mais l’adapte aux données non textuelles. Ce processus repose largement sur les bases de données vectorielles et les espaces sémantiques partagés.
-
Indexation : Les données provenant de diverses sources — PDF, vidéos et présentations — sont traitées. Des modèles d’extraction de caractéristiques convertissent ces différentes modalités en vecteurs numériques de grande dimension appelés embeddings. Par exemple, un modèle comme CLIP d’OpenAI aligne les embeddings d’images et de textes afin qu’une image de chien et le mot « chien » soient mathématiquement proches.
-
Récupération : Lorsqu’un utilisateur pose une question (p. ex. « Montre-moi le défaut présent sur cette carte électronique »), le système effectue une recherche sémantique dans la base de données vectorielle afin de trouver les images ou extraits vidéo les plus pertinents correspondant à l’intention de la requête.
-
Génération : Le contexte visuel récupéré est transmis à un modèle vision-langage (VLM). Le VLM traite à la fois l’invite textuelle de l’utilisateur et les caractéristiques de l’image récupérée pour générer une réponse finale, comme s’il « discutait » avec les données.
Applications concrètes#
Le RAG multimodal transforme les secteurs d’activité en permettant aux agents d’IA d’interagir avec le monde physique par l’intermédiaire de données visuelles.
- Maintenance industrielle et fabrication : Dans le domaine de l’IA dans la fabrication, les techniciens peuvent interroger un système avec une photo d’une pièce de machine cassée. Le système de RAG multimodal récupère des historiques de maintenance similaires, des schémas techniques et des tutoriels vidéo pour guider le processus de réparation. Cela réduit les temps d’arrêt et démocratise les connaissances expertes.
- Découverte dans le commerce et le e-commerce : Les applications utilisant l’IA dans le commerce permettent aux clients de téléverser une image d’une tenue qu’ils aiment. Le système récupère des articles visuellement similaires dans le stock actuel et génère des conseils de style ou des comparaisons de produits, créant ainsi une expérience d’achat hautement personnalisée.
Différencier les termes associés#
Pour comprendre la niche spécifique du RAG multimodal, il est utile de le distinguer des concepts associés :
- RAG multimodal et modèle multimodal : Un modèle multimodal (comme GPT-4o ou Gemini) crée la réponse. Le RAG multimodal est l’architecture qui fournit à ce modèle des données externes et privées (images, documents) sur lesquelles il n’a pas été entraîné. Le modèle est le moteur ; le RAG est la conduite d’alimentation.
- RAG multimodal et ajustement fin : L’ajustement fin met à jour de façon permanente les poids du modèle afin de lui apprendre une nouvelle tâche ou un nouveau style. Le RAG fournit des connaissances temporaires au moment de l’inférence. Le RAG est privilégié pour les données dynamiques (p. ex. l’inventaire quotidien), pour lesquelles un réentraînement fréquent n’est pas pratique.
Implémentation avec Ultralytics#
Les développeurs peuvent créer le composant de récupération d’un pipeline de RAG multimodal avec Ultralytics YOLO. En détectant et en classant les objets présents dans les images, YOLO fournit des métadonnées structurées qui peuvent être indexées pour une récupération fondée sur le texte ou utilisées pour recadrer les régions pertinentes d’une image destinée à un VLM. La plateforme Ultralytics simplifie l’entraînement de ces modèles de vision spécialisés afin qu’ils reconnaissent les objets personnalisés essentiels à ton domaine spécifique.
L’exemple suivant montre comment utiliser YOLO26 pour extraire le contexte visuel (les objets détectés) d’une image, qui pourrait ensuite être transmis à un LLM dans le cadre d’un workflow RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personLectures et ressources complémentaires#
- Documentation de LangChain : Un guide complet pour créer des pipelines de récupération, avec notamment la prise en charge du multimodal.
- Guide multimodal de LlamaIndex : Une documentation détaillée sur l’indexation et la récupération de types de données complexes pour les LLM.
- Google Cloud Vertex AI Search : Des fonctionnalités de recherche vectorielle de niveau entreprise pour créer des applications RAG évolutives.
- Solutions Ultralytics : Découvre comment la vision par ordinateur s’intègre à des systèmes d’IA plus larges dans divers secteurs d’activité.









