Multimodal RAG
Explore le RAG multimodal pour traiter le texte, les images et la vidéo. Apprends comment Ultralytics YOLO26 améliore les pipelines de récupération IA pour des réponses plus précises et contextuelles.
La génération augmentée par récupération multimodale (Multimodal RAG) est un framework d'intelligence artificielle (IA) avancé qui étend les systèmes RAG traditionnels pour traiter et raisonner sur divers types de données, tels que le texte, les images, la vidéo et l'audio. Alors que la génération augmentée par récupération (RAG) standard améliore la précision d'un modèle de langage de grande taille (LLM) en récupérant des documents textuels pertinents, le Multimodal RAG permet aux modèles de « voir » et d'« entendre » en extrayant du contexte d'une base de connaissances multimédia mixte. Cette approche ancre la génération du modèle dans des preuves visuelles ou auditives concrètes, réduisant considérablement les hallucinations dans les LLM et permettant des tâches complexes telles que la réponse visuelle à des questions sur des jeux de données privés. En tirant parti de l'apprentissage multimodal, ces systèmes peuvent synthétiser des informations à partir de la requête d'un utilisateur (par ex., du texte) et d'actifs récupérés (par ex., un diagramme ou une image de surveillance) pour produire des réponses complètes et adaptées au contexte.
Comment fonctionne le RAG multimodal#
L'architecture d'un système Multimodal RAG reflète généralement le pipeline standard « Récupérer puis Générer », mais l'adapte aux données non textuelles. Ce processus repose fortement sur les bases de données vectorielles et les espaces sémantiques partagés.
-
Indexation : Les données provenant de diverses sources — PDF, vidéos, diaporamas — sont traitées. Des modèles d'extraction de caractéristiques convertissent ces différentes modalités en vecteurs numériques de grande dimension appelés embeddings. Par exemple, un modèle comme CLIP d'OpenAI aligne les embeddings d'images et de texte de sorte qu'une image de chien et le mot « chien » soient mathématiquement proches.
-
Récupération : Lorsqu'un utilisateur pose une question (par ex., « Montre-moi le défaut sur ce circuit imprimé »), le système effectue une recherche sémantique dans la base de données vectorielle pour trouver les images ou clips vidéo les plus pertinents qui correspondent à l'intention de la requête.
-
Génération : Le contexte visuel récupéré est injecté dans un modèle vision-langage (VLM). Le VLM traite à la fois le texte de l'utilisateur et les caractéristiques de l'image récupérée pour générer une réponse finale, « discutant » ainsi efficacement avec les données.
Applications concrètes#
Le Multimodal RAG transforme les industries en permettant aux agents IA d'interagir avec le monde physique par le biais de données visuelles.
- Maintenance industrielle et fabrication : Dans le domaine de l'IA dans la fabrication, les techniciens peuvent interroger un système avec une photo d'une pièce de machine cassée. Le système Multimodal RAG récupère les journaux de maintenance historiques similaires, les schémas techniques et les tutoriels vidéo pour guider le processus de réparation. Cela réduit les temps d'arrêt et démocratise l'expertise.
- Découverte dans la vente au détail et le commerce électronique : Les applications utilisant l'IA dans la vente au détail permettent aux clients de télécharger une image d'une tenue qu'ils aiment. Le système récupère des articles visuellement similaires dans l'inventaire actuel et génère des conseils de style ou des comparaisons de produits, créant ainsi une expérience d'achat hautement personnalisée.
Différencier les termes associés#
Pour comprendre la niche spécifique du RAG multimodal, il est utile de le distinguer des concepts associés :
- Multimodal RAG vs modèle multimodal : Un modèle multimodal (comme GPT-4o ou Gemini) crée la réponse. Le Multimodal RAG est l'architecture qui alimente ce modèle en données externes et privées (images, documents) sur lesquelles il n'a pas été entraîné. Le modèle est le moteur ; le RAG est la conduite de carburant.
- Multimodal RAG vs réglage fin : Le réglage fin met à jour de manière permanente les poids du modèle pour apprendre une nouvelle tâche ou un nouveau style. Le RAG fournit des connaissances temporaires au moment de l'inférence. Le RAG est privilégié pour les données dynamiques (par ex., l'inventaire quotidien) où un réentraînement fréquent n'est pas pratique.
Implémentation avec Ultralytics#
Les développeurs peuvent créer le composant de récupération d'un pipeline Multimodal RAG en utilisant Ultralytics YOLO. En détectant et en classant les objets dans les images, YOLO fournit des métadonnées structurées qui peuvent être indexées pour la recherche textuelle ou utilisées pour recadrer des régions d'image pertinentes pour un VLM. La plateforme Ultralytics simplifie l'entraînement de ces modèles de vision spécialisés pour reconnaître des objets personnalisés essentiels à ton domaine spécifique.
L'exemple suivant montre comment utiliser YOLO26 pour extraire le contexte visuel (objets détectés) d'une image, qui pourrait ensuite être transmis à un LLM dans le cadre d'un flux de travail RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personLectures complémentaires et ressources#
- Documentation de LangChain : Un guide complet pour créer des pipelines de récupération, incluant la prise en charge multimodale.
- Guide multimodal de LlamaIndex : Documentation détaillée sur l'indexation et la récupération de types de données complexes pour les LLM.
- Google Cloud Vertex AI Search : Des capacités de recherche vectorielle de niveau entreprise pour créer des applications RAG évolutives.
- Solutions Ultralytics : Découvre comment la vision par ordinateur s'intègre aux systèmes d'IA plus larges dans diverses industries.






