Améliorer les applications d’IA avec RAG et la vision par ordinateur
Découvre comment l’association de la génération augmentée par récupération (RAG) et de la vision par ordinateur aide les systèmes d’IA à interpréter des documents, des éléments visuels et des contenus complexes du monde réel.

L’utilisation d’outils d’IA comme ChatGPT ou Gemini devient rapidement un moyen courant de trouver des informations. Que tu rédiges un message, résumes un document ou répondes à une question, ces outils proposent souvent une solution plus rapide et plus simple.
Mais si tu as utilisé des modèles de langage de grande taille (LLMs) à plusieurs reprises, tu as probablement remarqué leurs limites. Lorsqu’on leur soumet des requêtes très spécifiques ou urgentes, ils peuvent fournir des réponses incorrectes, souvent avec assurance.
Cela s’explique par le fait que les LLMs autonomes reposent uniquement sur les données avec lesquelles ils ont été entraînés. Ils n’ont pas accès aux dernières mises à jour ni aux connaissances spécialisées qui ne figurent pas dans cet ensemble de données. Leurs réponses peuvent donc être obsolètes ou inexactes.
Pour contribuer à résoudre ce problème, des chercheurs ont développé une méthode appelée génération augmentée par récupération (RAG). La RAG améliore les modèles de langage en leur permettant d’extraire des informations récentes et pertinentes depuis des sources fiables lorsqu’ils répondent à des requêtes.
Dans cet article, nous allons découvrir comment fonctionne la RAG et comment elle améliore les outils d’IA en récupérant des informations pertinentes et à jour. Nous verrons également comment elle fonctionne avec la vision par ordinateur, un domaine de l’intelligence artificielle axé sur l’interprétation des données visuelles, afin d’aider les systèmes à comprendre non seulement le texte, mais aussi les images, les mises en page et les documents visuellement complexes.
Comprendre la génération augmentée par récupération (RAG)#
Lorsque tu poses une question à un chatbot d’IA, tu t’attends généralement à plus qu’une réponse qui semble convaincante. Idéalement, une bonne réponse doit être claire, exacte et réellement utile. Pour y parvenir, le modèle d’IA a besoin de plus que de compétences linguistiques : il doit également avoir accès aux bonnes informations, en particulier pour les sujets spécifiques ou urgents.
La RAG est une technique qui aide à combler cette lacune. Elle associe la capacité du modèle de langage à comprendre et à générer du texte à la puissance de récupération d’informations pertinentes depuis des sources externes. Au lieu de s’appuyer uniquement sur ses données d’entraînement, le modèle extrait activement du contenu complémentaire depuis des bases de connaissances fiables lors de la formulation de sa réponse.

Fig. 1. Principaux cas d’utilisation de la RAG. Image réalisée par l’auteur.
Tu peux voir cela comme le fait de poser une question à quelqu’un qui consulte une référence fiable avant de répondre. Sa réponse est toujours formulée avec ses propres mots, mais elle s’appuie sur les informations les plus pertinentes et les plus à jour.
Cette approche aide les LLMs à fournir des réponses plus complètes, plus exactes et mieux adaptées à la requête de l’utilisateur, ce qui les rend bien plus fiables dans les applications concrètes où la précision est réellement importante.
Comment fonctionne la RAG#
La RAG améliore la manière dont un modèle de langage de grande taille répond en introduisant deux étapes clés : la récupération et la génération. Elle récupère d’abord les informations pertinentes depuis une base de connaissances externe. Elle utilise ensuite ces informations pour générer une réponse bien structurée et tenant compte du contexte.
Prenons un exemple simple pour voir comment ce processus fonctionne. Imagine que tu utilises un assistant d’IA pour gérer tes finances personnelles et que tu veuilles vérifier si tu es resté dans ton objectif de dépenses pour le mois.
Le processus commence lorsque tu poses à l’assistant une question comme : « Ai-je respecté mon budget ce mois-ci ? » Au lieu de s’appuyer uniquement sur ce qu’il a appris pendant son entraînement, le système utilise un récupérateur pour parcourir tes données financières les plus récentes, comme des relevés bancaires ou des récapitulatifs de transactions. Il cherche à comprendre l’intention de ta question et rassemble les informations les plus pertinentes.
Une fois ces informations récupérées, le modèle de langage prend le relais. Il traite à la fois ta question et les données extraites de tes relevés afin de générer une réponse claire et utile. Plutôt que d’énumérer des détails bruts, la réponse résume tes dépenses et te fournit une analyse directe et pertinente, par exemple en confirmant si tu as atteint ton objectif et en signalant les principaux postes de dépenses.
Cette approche aide le LLM à fournir des réponses non seulement exactes, mais aussi fondées sur tes informations réelles et à jour, ce qui rend l’expérience bien plus utile qu’avec un modèle qui ne travaille qu’à partir de données d’entraînement statiques.

Fig. 2. Comprendre le fonctionnement de la RAG.
La nécessité des systèmes RAG multimodaux#
En général, les informations ne sont pas toujours communiquées sous forme de texte brut. Des examens médicaux et schémas aux diapositives de présentation et aux documents numérisés, les éléments visuels contiennent souvent des détails importants. Les LLMs traditionnels, principalement conçus pour lire et comprendre du texte, peuvent avoir du mal à traiter ce type de contenu.
Cependant, la RAG peut être utilisée avec la vision par ordinateur pour combler cette lacune. Lorsqu’elles sont associées, elles forment ce que l’on appelle un système RAG multimodal, capable de traiter à la fois le texte et les éléments visuels, afin d’aider les chatbots d’IA à fournir des réponses plus exactes et plus complètes.
Au cœur de cette approche se trouvent les modèles vision-langage (VLMs), conçus pour traiter et interpréter ces deux types d’entrées. Dans cette configuration, la RAG récupère les informations les plus pertinentes à partir de grandes sources de données, tandis que le VLM, grâce à la vision par ordinateur, interprète les images, les mises en page et les schémas.
Cette approche est particulièrement utile pour les documents du monde réel, comme les formulaires numérisés, les rapports médicaux ou les diapositives de présentation, dans lesquels des détails essentiels peuvent se trouver à la fois dans le texte et les éléments visuels. Par exemple, lors de l’analyse d’un document contenant des images ainsi que des tableaux et des paragraphes, un système multimodal peut extraire les éléments visuels, générer un résumé de ce qu’ils montrent et associer ces informations au texte environnant pour fournir une réponse plus complète et plus utile.

Fig. 3. La RAG multimodale utilise des images et du texte pour fournir de meilleures réponses.
Applications de la RAG aux données visuelles#
Maintenant que nous avons expliqué ce qu’est la RAG et comment elle fonctionne avec la vision par ordinateur, examinons quelques exemples concrets et projets de recherche qui montrent comment cette approche est utilisée.
Comprendre les documents visuels avec VisRAG#
Supposons que tu essaies d’extraire des informations utiles d’un rapport financier ou d’un document juridique numérisé. Ces fichiers contiennent souvent non seulement du texte, mais aussi des tableaux, des graphiques et des mises en page qui contribuent à expliquer les informations. Un modèle de langage classique peut négliger ou mal interpréter ces éléments visuels, ce qui entraîne des réponses incomplètes ou inexactes.
VisRAG a été créé par des chercheurs pour relever ce défi. Il s’agit d’un pipeline RAG basé sur un VLM qui traite chaque page comme une image au lieu de traiter uniquement le texte. Le système peut ainsi comprendre à la fois le contenu et sa structure visuelle. Il peut donc trouver les parties les plus pertinentes et fournir des réponses plus claires, plus exactes et fondées sur l’ensemble du contexte du document.

Fig. 4. VisRAG peut lire les documents comme des images pour en saisir le contenu textuel et la mise en page.
Réponse à des questions visuelles avec la RAG#
La réponse visuelle aux questions (VQA) est une tâche au cours de laquelle un système d’IA répond à des questions sur des images. De nombreux systèmes de VQA existants se concentrent sur les réponses à des questions concernant un seul document, sans avoir besoin de rechercher des informations supplémentaires : on parle alors de contexte fermé.
VDocRAG est un framework RAG qui adopte une approche plus réaliste. Il intègre la VQA à la capacité de récupérer d’abord les documents pertinents. Cette approche est utile dans les situations réelles où la question d’un utilisateur peut concerner l’un de nombreux documents et où le système doit trouver le bon avant de répondre. Pour cela, VDocRAG utilise des VLMs afin d’analyser les documents comme des images, tout en préservant leur texte et leur structure visuelle.
VDocRAG est ainsi particulièrement utile dans des applications comme la recherche en entreprise, l’automatisation documentaire et le support client. Il peut aider les équipes à extraire rapidement des réponses de documents complexes à la mise en page élaborée, comme des manuels ou des documents de politique interne, pour lesquels comprendre la structure est tout aussi important que lire les mots.

Fig. 5. La différence entre VDocRAG et les solutions basées sur les LLMs.
Améliorer la génération de légendes d’images avec la RAG#
La génération de légendes d’images consiste à produire une description écrite de ce qui se passe dans une image. Elle est utilisée dans diverses applications : rendre les contenus en ligne plus accessibles, alimenter la recherche d’images et prendre en charge la modération de contenu et les systèmes de recommandation.
Cependant, générer des légendes exactes n’est pas toujours facile pour les modèles d’IA. C’est particulièrement difficile lorsque l’image montre quelque chose de différent de ce sur quoi le modèle a été entraîné. De nombreux systèmes de génération de légendes dépendent fortement des données d’entraînement ; lorsqu’ils sont confrontés à des scènes inconnues, leurs légendes peuvent être vagues ou inexactes.
Pour relever ce défi, des chercheurs ont développé Re-ViLM, une méthode qui intègre la génération augmentée par récupération (RAG) à la génération de légendes d’images. Au lieu de générer une légende à partir de zéro, Re-ViLM récupère dans une base de données des paires image-texte similaires et les utilise pour guider la production de la légende.
Cette approche fondée sur la récupération aide le modèle à ancrer ses descriptions dans des exemples pertinents, améliorant ainsi leur exactitude et leur fluidité. Les premiers résultats montrent que Re-ViLM génère des légendes plus naturelles et tenant compte du contexte en utilisant des exemples réels, ce qui contribue à réduire les descriptions vagues ou inexactes.

Fig. 6. Re-ViLM améliore les légendes d’images en récupérant des exemples visuels et textuels.
Avantages et inconvénients de l’utilisation de la RAG pour comprendre les données visuelles#
Voici un aperçu rapide des avantages de l’application des techniques de génération augmentée par récupération pour récupérer et utiliser des informations visuelles :
- Capacités améliorées de résumé : Les résumés peuvent intégrer des informations issues des éléments visuels, comme les tendances d’un graphique ou les éléments d’une infographie, et pas seulement du texte.
- Recherche et récupération plus robustes : Les étapes de récupération peuvent identifier des pages visuelles pertinentes même lorsque les mots-clés ne sont pas présents dans le texte, grâce à la compréhension fondée sur les images.
- Prise en charge des documents numérisés, manuscrits ou fondés sur des images : Les pipelines RAG s’appuyant sur des VLMs peuvent traiter du contenu illisible pour les modèles qui ne traitent que du texte.
Malgré ces avantages, l’utilisation de la RAG avec des données visuelles présente encore quelques limites à garder à l’esprit. Voici quelques-unes des principales :
- Besoins élevés en calcul : L’analyse des images et du texte utilise davantage de mémoire et de puissance de traitement, ce qui peut ralentir les performances ou augmenter les coûts.
- Problèmes de confidentialité des données et de sécurité : Les documents visuels, en particulier dans des secteurs comme la santé ou la finance, peuvent contenir des informations sensibles qui compliquent les workflows de récupération et de traitement.
- Temps d’inférence plus longs : Le traitement visuel ajoutant de la complexité, la génération des réponses peut prendre plus de temps qu’avec des systèmes qui ne traitent que du texte.
Points clés à retenir#
La génération augmentée par récupération améliore la manière dont les modèles de langage de grande taille répondent aux questions en leur permettant de récupérer des informations pertinentes et à jour depuis des sources externes. Associés à la vision par ordinateur, ces systèmes peuvent traiter non seulement du texte, mais aussi du contenu visuel comme des graphiques, des tableaux, des images et des documents numérisés, ce qui permet d’obtenir des réponses plus exactes et plus complètes.
Cette approche rend les LLMs mieux adaptés aux tâches concrètes impliquant des documents complexes. En réunissant la récupération et la compréhension visuelle, ces modèles peuvent interpréter plus efficacement des formats variés et fournir des informations plus utiles dans des contextes pratiques du quotidien.
Rejoins notre communauté grandissante ! Explore notre dépôt GitHub pour approfondir tes connaissances en IA. Prêt à démarrer tes propres projets de vision par ordinateur ? Découvre nos options de licence. En savoir plus sur l’IA dans le secteur de la santé et la vision par ordinateur dans le commerce de détail sur nos pages dédiées aux solutions !









