KI-Anwendungen mit RAG und Computer Vision verbessern
Erfahre, wie die Kombination aus durch Abruf erweiterter Generierung (RAG) und Computer Vision KI-Systemen hilft, Dokumente, visuelle Inhalte und komplexe reale Inhalte zu interpretieren.

Die Verwendung von KI-Tools wie ChatGPT oder Gemini wird schnell zu einer gängigen Möglichkeit, Informationen zu finden. Ganz gleich, ob du eine Nachricht formulierst, ein Dokument zusammenfasst oder eine Frage beantwortest – diese Tools bieten oft eine schnellere und einfachere Lösung.
Wenn du jedoch schon einige Male große Sprachmodelle (LLMs) verwendet hast, sind dir wahrscheinlich ihre Grenzen aufgefallen. Bei sehr spezifischen oder zeitkritischen Fragen können sie falsche Antworten geben – oft mit großer Überzeugung.
Das liegt daran, dass eigenständige LLMs ausschließlich auf den Daten basieren, mit denen sie trainiert wurden. Sie haben keinen Zugriff auf die neuesten Aktualisierungen oder auf spezielles Wissen außerhalb dieses Datensatzes. Daher können ihre Antworten veraltet oder ungenau sein.
Um dieses Problem zu lösen, haben Forschende eine Methode namens abrufgestützte Generierung (RAG) entwickelt. RAG verbessert Sprachmodelle, indem es ihnen ermöglicht, bei der Beantwortung von Fragen aktuelle, relevante Informationen aus vertrauenswürdigen Quellen abzurufen.
In diesem Artikel untersuchen wir, wie RAG funktioniert und wie es KI-Tools verbessert, indem es relevante und aktuelle Informationen abruft. Außerdem sehen wir uns an, wie es zusammen mit Computer Vision funktioniert – einem Bereich der künstlichen Intelligenz, der sich auf die Interpretation visueller Daten konzentriert –, damit Systeme nicht nur Texte, sondern auch Bilder, Layouts und visuell komplexe Dokumente verstehen können.
Abrufgestützte Generierung (RAG) verstehen#
Wenn wir einem KI-Chatbot eine Frage stellen, erwarten wir normalerweise mehr als nur eine gut klingende Antwort. Idealerweise sollte eine gute Antwort klar, korrekt und wirklich hilfreich sein. Dafür benötigt das KI-Modell mehr als nur Sprachkenntnisse: Es braucht auch Zugriff auf die richtigen Informationen, insbesondere bei spezifischen oder zeitkritischen Themen.
RAG ist eine Technik, die hilft, diese Lücke zu schließen. Sie verbindet die Fähigkeit des Sprachmodells, Texte zu verstehen und zu erzeugen, mit der Möglichkeit, relevante Informationen aus externen Quellen abzurufen. Statt sich ausschließlich auf seine Trainingsdaten zu verlassen, ruft das Modell während der Formulierung seiner Antwort aktiv unterstützende Inhalte aus vertrauenswürdigen Wissensdatenbanken ab.

Abb. 1. Wichtige RAG-Anwendungsfälle. Bild vom Autor.
Du kannst dir das so vorstellen, als würdest du jemandem eine Frage stellen und die Person vor der Antwort in einem zuverlässigen Nachschlagewerk nachsehen. Die Antwort ist weiterhin in ihren eigenen Worten formuliert, basiert aber auf den relevantesten und aktuellsten Informationen.
Dieser Ansatz hilft LLMs, vollständigere, genauere und stärker auf die Frage des Benutzers zugeschnittene Antworten zu geben. Dadurch werden sie in realen Anwendungen, in denen Genauigkeit wirklich zählt, deutlich zuverlässiger.
So funktioniert RAG#
RAG verbessert die Antworten eines großen Sprachmodells durch zwei wichtige Schritte: Abruf und Generierung. Zuerst ruft es relevante Informationen aus einer externen Wissensdatenbank ab. Anschließend verwendet es diese Informationen, um eine gut formulierte, kontextbezogene Antwort zu erzeugen.
Sehen wir uns ein einfaches Beispiel an, um zu verstehen, wie dieser Prozess funktioniert. Stell dir vor, du verwendest einen KI-Assistenten, um deine persönlichen Finanzen zu verwalten, und möchtest prüfen, ob du dein Ausgabenziel für den Monat eingehalten hast.
Der Prozess beginnt, wenn du dem Assistenten eine Frage stellst, etwa: „Habe ich diesen Monat mein Budget eingehalten?“ Statt sich nur auf das zu verlassen, was das System während des Trainings gelernt hat, durchsucht ein Retriever deine aktuellsten Finanzunterlagen, etwa Kontoauszüge oder Transaktionsübersichten. Dabei konzentriert es sich darauf, die Absicht hinter deiner Frage zu verstehen und die relevantesten Informationen zusammenzutragen.
Sobald diese Informationen abgerufen wurden, übernimmt das Sprachmodell. Es verarbeitet sowohl deine Frage als auch die aus deinen Unterlagen abgerufenen Daten, um eine klare und hilfreiche Antwort zu erzeugen. Anstatt Rohdaten aufzulisten, fasst die Antwort deine Ausgaben zusammen und liefert dir eine direkte, aussagekräftige Einschätzung – etwa indem sie bestätigt, ob du dein Ziel erreicht hast, und wichtige Ausgabenbereiche hervorhebt.
Dieser Ansatz hilft dem LLM, Antworten zu liefern, die nicht nur korrekt sind, sondern auch auf deinen realen, aktuellen Informationen basieren. Dadurch ist die Erfahrung deutlich nützlicher als bei einem Modell, das ausschließlich mit statischen Trainingsdaten arbeitet.

Abb. 2. So funktioniert RAG.
Der Bedarf an multimodalen RAG-Systemen#
Informationen werden nicht immer als reiner Text weitergegeben. Von medizinischen Aufnahmen und Diagrammen bis hin zu Präsentationsfolien und gescannten Dokumenten enthalten visuelle Darstellungen oft wichtige Details. Herkömmliche LLMs, die hauptsächlich darauf ausgelegt sind, Texte zu lesen und zu verstehen, können mit solchen Inhalten Schwierigkeiten haben.
RAG kann jedoch zusammen mit Computer Vision eingesetzt werden, um diese Lücke zu schließen. Werden beide miteinander verbunden, entsteht ein sogenanntes multimodales RAG-System – eine Lösung, die sowohl Texte als auch visuelle Inhalte verarbeiten kann und KI-Chatbots dabei unterstützt, genauere und vollständigere Antworten zu geben.
Im Mittelpunkt dieses Ansatzes stehen Modelle für Bild- und Sprachverarbeitung (VLMs), die darauf ausgelegt sind, beide Arten von Eingaben zu verarbeiten und daraus Schlussfolgerungen zu ziehen. In diesem Aufbau ruft RAG die relevantesten Informationen aus großen Datenquellen ab, während das durch Computer Vision unterstützte VLM Bilder, Layouts und Diagramme interpretiert.
Das ist besonders nützlich für reale Dokumente wie gescannte Formulare, medizinische Berichte oder Präsentationsfolien, bei denen wichtige Details sowohl im Text als auch in den visuellen Elementen zu finden sein können. Bei der Analyse eines Dokuments mit Bildern neben Tabellen und Absätzen kann ein multimodales System beispielsweise visuelle Elemente extrahieren, eine Zusammenfassung ihres Inhalts erstellen und diese mit dem umgebenden Text verbinden, um eine vollständigere und hilfreichere Antwort zu liefern.

Abb. 3. Multimodales RAG nutzt Bilder und Texte für bessere Antworten.
Anwendungen von RAG für visuelle Daten#
Nachdem wir besprochen haben, was RAG ist und wie es mit Computer Vision funktioniert, sehen wir uns nun einige Beispiele aus der Praxis und Forschungsprojekte an, die zeigen, wie dieser Ansatz eingesetzt wird.
Visuelle Dokumente mit VisRAG verstehen#
Angenommen, du möchtest Erkenntnisse aus einem Finanzbericht oder einem gescannten Rechtsdokument gewinnen. Solche Dateien enthalten oft nicht nur Text, sondern auch Tabellen, Diagramme und Layouts, die zum Verständnis der Informationen beitragen. Ein einfaches Sprachmodell könnte diese visuellen Elemente übersehen oder falsch interpretieren, was zu unvollständigen oder ungenauen Antworten führt.
VisRAG wurde von Forschenden entwickelt, um diese Herausforderung zu bewältigen. Es handelt sich um eine auf VLMs basierende RAG-Pipeline, die jede Seite als Bild behandelt, anstatt nur den Text zu verarbeiten. Dadurch kann das System sowohl den Inhalt als auch die visuelle Struktur verstehen. So findet es die relevantesten Stellen und liefert klarere, genauere Antworten, die den vollständigen Kontext des Dokuments berücksichtigen.

Abb. 4. VisRAG kann Dokumente als Bilder lesen, um Textinhalte und Layout zu erfassen.
Visuelle Fragebeantwortung mit RAG#
Visuelle Fragebeantwortung (VQA) ist eine Aufgabe, bei der ein KI-System Fragen zu Bildern beantwortet. Viele bestehende VQA-Systeme konzentrieren sich darauf, Fragen zu einem einzelnen Dokument zu beantworten, ohne zusätzliche Informationen suchen zu müssen – dies wird als geschlossene Umgebung bezeichnet.
VDocRAG ist ein RAG-Framework, das einen realistischeren Ansatz verfolgt. Es verbindet VQA mit der Möglichkeit, zunächst relevante Dokumente abzurufen. Das ist in realen Situationen nützlich, in denen sich die Frage eines Benutzers auf eines von vielen Dokumenten beziehen kann und das System vor der Beantwortung das richtige Dokument finden muss. Dafür verwendet VDocRAG VLMs, um Dokumente als Bilder zu analysieren und dabei sowohl deren Text als auch ihre visuelle Struktur zu erhalten.
Dadurch ist VDocRAG besonders wirkungsvoll in Anwendungen wie der Unternehmenssuche, der Dokumentenautomatisierung und dem Kundensupport. Teams können damit schnell Antworten aus komplexen, visuell formatierten Dokumenten wie Handbüchern oder Richtliniendokumenten extrahieren, bei denen das Verständnis des Layouts genauso wichtig ist wie das Lesen der Wörter.

Abb. 5. Der Unterschied zwischen VDocRAG und LLM-basierten Lösungen.
Bildbeschreibungen mit RAG verbessern#
Bildbeschreibungen umfassen die Erstellung einer schriftlichen Beschreibung dessen, was in einem Bild geschieht. Sie werden in verschiedenen Anwendungen eingesetzt – von der besseren Zugänglichkeit von Online-Inhalten über die Bildersuche bis hin zur Unterstützung von Systemen zur Inhaltsmoderation und Empfehlung.
Genaue Bildbeschreibungen zu erzeugen, ist für KI-Modelle jedoch nicht immer einfach. Besonders schwierig wird es, wenn das Bild etwas anderes zeigt als die Inhalte, mit denen das Modell trainiert wurde. Viele Systeme zur Erstellung von Bildbeschreibungen stützen sich stark auf Trainingsdaten. Bei unbekannten Szenen können ihre Beschreibungen daher vage oder ungenau ausfallen.
Um dieses Problem zu lösen, entwickelten Forschende Re-ViLM, eine Methode, die abrufgestützte Generierung (RAG) in die Erstellung von Bildbeschreibungen integriert. Statt eine Beschreibung von Grund auf zu erzeugen, ruft Re-ViLM ähnliche Bild-Text-Paare aus einer Datenbank ab und nutzt sie, um die erzeugte Beschreibung zu steuern.
Dieser abrufbasierte Ansatz hilft dem Modell, seine Beschreibungen auf relevanten Beispielen aufzubauen, und verbessert dadurch sowohl die Genauigkeit als auch die Sprachflüssigkeit. Erste Ergebnisse zeigen, dass Re-ViLM durch die Verwendung realer Beispiele natürlichere, kontextbezogene Bildbeschreibungen erzeugt und so dazu beiträgt, vage oder ungenaue Beschreibungen zu vermeiden.

Abb. 6. Re-ViLM verbessert Bildbeschreibungen durch das Abrufen visueller Textbeispiele.
Vor- und Nachteile von RAG zum Verständnis visueller Daten#
Hier ist ein kurzer Überblick über die Vorteile, die sich ergeben, wenn Techniken der abrufgestützten Generierung zum Abrufen und Verwenden visueller Informationen eingesetzt werden:
- Verbesserte Zusammenfassungsfunktionen: Zusammenfassungen können Erkenntnisse aus visuellen Darstellungen wie Diagrammtrends oder Elementen von Infografiken einbeziehen, nicht nur aus Text.
- Robustere Suche und Informationsabfrage: Die Abrufschritte können relevante visuelle Seiten identifizieren, selbst wenn bestimmte Suchbegriffe im Text nicht vorkommen, indem sie ein bildbasiertes Verständnis nutzen.
- Unterstützung für gescannte, handgeschriebene oder bildbasierte Dokumente: Durch VLMs unterstützte RAG-Pipelines können Inhalte verarbeiten, die für rein textbasierte Modelle nicht lesbar wären.
Trotz dieser Vorteile gibt es einige Einschränkungen, die du bei der Arbeit mit visuellen Daten und RAG beachten solltest. Hier sind einige der wichtigsten:
- Hoher Rechenaufwand: Die Analyse von Bildern und Texten benötigt mehr Speicher und Rechenleistung, was die Leistung verlangsamen oder die Kosten erhöhen kann.
- Bedenken hinsichtlich Datenschutz und Sicherheit: Visuelle Dokumente, insbesondere in Bereichen wie Gesundheitswesen oder Finanzwesen, können sensible Informationen enthalten, die Abruf- und Verarbeitungsabläufe erschweren.
- Längere Inferenzzeiten: Da die Verarbeitung visueller Inhalte zusätzliche Komplexität mit sich bringt, kann die Erzeugung von Antworten im Vergleich zu rein textbasierten Systemen länger dauern.
Wichtige Erkenntnisse#
Die abrufgestützte Generierung verbessert die Art und Weise, wie große Sprachmodelle Fragen beantworten, indem sie ihnen ermöglicht, relevante und aktuelle Informationen aus externen Quellen abzurufen. In Verbindung mit Computer Vision können diese Systeme nicht nur Texte, sondern auch visuelle Inhalte wie Diagramme, Tabellen, Bilder und gescannte Dokumente verarbeiten. Das führt zu genaueren und umfassenderen Antworten.
Dieser Ansatz macht LLMs besser für reale Aufgaben geeignet, die komplexe Dokumente umfassen. Durch die Verbindung von Informationsabruf und visueller Analyse können diese Modelle unterschiedliche Formate effektiver interpretieren und Erkenntnisse liefern, die in praktischen Alltagssituationen nützlicher sind.
Werde Teil unserer wachsenden Community! Sieh dir unser GitHub-Repository an, um tiefer in die KI einzusteigen. Bereit, deine eigenen Computer-Vision-Projekte zu starten? Entdecke unsere Lizenzoptionen. Erfahre auf unseren Lösungsseiten mehr über KI im Gesundheitswesen und Computer Vision im Einzelhandel!









