Retrieval Augmented Generation (RAG)
Explore comment la génération augmentée par récupération (RAG) optimise les LLM avec des données en temps réel. Découvre comment créer des pipelines multimodaux avec Ultralytics YOLO26 pour le RAG visuel.
La génération augmentée par récupération (RAG) est une technique avancée dans le domaine de l’intelligence artificielle qui optimise la sortie d’un grand modèle de langage (LLM) en se référant à une base de connaissances faisant autorité, extérieure à ses données d’entraînement. Les modèles génératifs traditionnels s’appuient exclusivement sur des informations statiques acquises lors de leur entraînement initial, ce qui peut entraîner des réponses obsolètes ou des inexactitudes formulées avec assurance, connues sous le nom d’hallucinations. La RAG comble cette lacune en récupérant des informations pertinentes et à jour auprès de sources externes — telles que des bases de données d’entreprise, l’actualité ou des manuels techniques — puis en les fournissant au modèle comme contexte avant la génération d’une réponse. Ce processus garantit que les sorties de l’IA sont non seulement cohérentes sur le plan linguistique, mais aussi factuellement exactes et ancrées dans des données spécifiques.
Fonctionnement des systèmes RAG#
L’architecture d’un système RAG comporte généralement deux phases principales : la récupération et la génération. Ce flux de travail permet aux développeurs de conserver un modèle de fondation sans devoir procéder à des réentraînements fréquents et coûteux.
-
Récupération : Lorsqu’un utilisateur envoie une requête, le système effectue d’abord une recherche sémantique dans un système de stockage spécialisé appelé base de données vectorielle. Cette base de données contient des données converties en représentations numériques appelées plongements, ce qui permet au système de trouver des informations conceptuellement similaires plutôt que de simplement faire correspondre des mots-clés.
-
Génération : Les documents ou extraits de données pertinents trouvés lors de la récupération sont combinés à la question initiale de l’utilisateur. Ce prompt enrichi est ensuite envoyé au modèle génératif. Le modèle utilise le contexte fourni pour synthétiser une réponse, en veillant à ce que celle-ci repose sur les faits récupérés. Pour approfondir les mécanismes, IBM propose un guide complet sur les flux de travail RAG.
RAG visuelle : intégrer la vision par ordinateur#
Bien que la RAG repose traditionnellement sur le texte, l’essor de l’apprentissage multimodal a introduit la « RAG visuelle ». Dans ce scénario, les modèles de vision par ordinateur jouent le rôle de mécanisme de récupération. Ils analysent des images ou des flux vidéo afin d’en extraire des données textuelles structurées — telles que les noms et le nombre d’objets ou les activités — qui sont ensuite transmises à un LLM pour répondre à des questions sur la scène visuelle.
Par exemple, un développeur peut utiliser YOLO26 pour détecter des objets dans une image et transmettre cette liste d’objets à un modèle textuel afin de générer un rapport descriptif.
from ultralytics import YOLO
# Load the YOLO26 model for state-of-the-art detection
model = YOLO("yolo26n.pt")
# Perform inference to 'retrieve' visual facts from an image
results = model("https://ultralytics.com/images/bus.jpg")
# Extract class names to build a text context for an LLM
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
context_string = f"The scene contains: {', '.join(detected_classes)}."
print(context_string)
# Output example: "The scene contains: bus, person, person, person."Applications concrètes#
La RAG transforme les secteurs d’activité en permettant aux agents d’IA d’accéder de manière sécurisée à des données propriétaires ou en temps réel.
- Bases de connaissances d’entreprise : Les entreprises utilisent la RAG pour créer des chatbots internes capables de répondre aux questions des employés sur les politiques RH ou la documentation technique. En connectant un LLM à un référentiel documentaire actif, le système évite de fournir des informations obsolètes sur les politiques de l’entreprise. Pour en savoir plus sur les implémentations en entreprise, consulte la présentation de Google Cloud sur la RAG dans Vertex AI.
- Aide à la décision clinique : Dans le domaine de l’IA dans le secteur de la santé, les systèmes RAG peuvent récupérer les antécédents des patients et les articles récents de recherche médicale pour aider les médecins à établir un diagnostic, en veillant à ce que les recommandations tiennent compte des études cliniques les plus récentes.
- Assistants intelligents pour le commerce de détail : Les applications utilisant l’IA dans le commerce de détail exploitent la RAG pour consulter les bases de données d’inventaire en temps réel. Si un client demande à un chatbot : « Avez-vous ces chaussures de course en taille 10 ? », le modèle récupère les niveaux de stock en temps réel avant de répondre, évitant ainsi la frustration liée aux articles en rupture de stock.
RAG ou ajustement fin#
Il est essentiel de distinguer la RAG de l’ajustement fin, car ces deux approches répondent à des problèmes différents.
- RAG (génération augmentée par récupération) : Idéale pour accéder à des données dynamiques qui changent fréquemment (par exemple, les cours des actions ou l’actualité) ou à des données privées absentes de l’ensemble public d’entraînement. Elle se concentre sur la fourniture de nouvelles informations au moment de l’exécution.
- Ajustement fin : Idéal pour adapter le comportement, le style ou la terminologie du modèle. Il consiste à mettre à jour les poids du modèle sur un jeu de données spécifique. Bien que l’ajustement fin aide un modèle à apprendre un schéma linguistique particulier (comme le jargon médical), il ne lui donne pas accès aux faits en temps réel. Consulte le guide d’OpenAI sur l’ajustement fin par rapport à la RAG pour découvrir des cadres d’aide à la décision.
Concepts associés#
- LangChain : Un framework open source populaire conçu spécifiquement pour simplifier la création d’applications RAG en reliant des récupérateurs et des LLM.
- Graphe de connaissances : Une manière structurée de représenter les données, qui peut servir de source de récupération et offrir des relations plus riches sur le plan contextuel qu’une simple similarité vectorielle.
- Ingénierie des prompts : L’art de concevoir des entrées pour guider le modèle. La RAG est essentiellement une forme automatisée d’ingénierie des prompts, dans laquelle le « prompt » est enrichi par des données récupérées de manière programmatique.
- Plateforme Ultralytics : Alors que la RAG prend en charge la génération de texte, des plateformes comme celle-ci sont essentielles pour gérer le prétraitement des données et l’entraînement des modèles de vision qui injectent des données visuelles dans les pipelines RAG multimodaux.









