Retrieval Augmented Generation (RAG)
Entdecke, wie Retrieval Augmented Generation (RAG) LLMs mit Echtzeitdaten optimiert. Erfahre, wie du multimodale Pipelines mit Ultralytics YOLO26 für visuelles RAG entwickelst.
Retrieval-Augmented Generation (RAG) ist eine fortschrittliche Technik im Bereich der künstlichen Intelligenz, die die Ausgabe eines großen Sprachmodells (LLM) optimiert, indem sie auf eine maßgebliche Wissensbasis außerhalb der Trainingsdaten des Modells zurückgreift. Herkömmliche generative Modelle stützen sich ausschließlich auf statische Informationen, die sie während ihres anfänglichen Trainings gelernt haben. Dies kann zu veralteten Antworten oder selbstsicher vorgetragenen Ungenauigkeiten führen, die als Halluzinationen bezeichnet werden. RAG schließt diese Lücke, indem relevante und aktuelle Informationen aus externen Quellen abgerufen werden – etwa aus Unternehmensdatenbanken, aktuellen Nachrichten oder technischen Handbüchern – und dem Modell vor der Antwortgenerierung als Kontext zugeführt werden. Dadurch wird sichergestellt, dass die Ausgaben der KI nicht nur sprachlich schlüssig, sondern auch sachlich korrekt und auf konkreten Daten basierend sind.
Funktionsweise von RAG-Systemen#
Die Architektur eines RAG-Systems umfasst typischerweise zwei Hauptphasen: Abruf und Generierung. Dieser Ablauf ermöglicht es Entwicklern, ein Basismodell zu pflegen, ohne es kostenintensiv regelmäßig neu trainieren zu müssen.
-
Abruf: Wenn ein Benutzer eine Anfrage stellt, führt das System zunächst eine semantische Suche in einem spezialisierten Speichersystem durch, das als Vektordatenbank bezeichnet wird. Diese Datenbank enthält Daten, die in numerische Repräsentationen, sogenannte Embeddings, umgewandelt wurden. Dadurch kann das System konzeptionell ähnliche Informationen finden, anstatt nur nach übereinstimmenden Schlüsselwörtern zu suchen.
-
Generierung: Die beim Abruf gefundenen relevanten Dokumente oder Datenausschnitte werden mit der ursprünglichen Frage des Benutzers kombiniert. Dieser angereicherte Prompt wird anschließend an das generative Modell gesendet. Das Modell nutzt den bereitgestellten Kontext, um eine Antwort zu formulieren, die auf den abgerufenen Fakten basiert. Eine ausführliche Erläuterung der Abläufe findest du im umfassenden Leitfaden von IBM zu RAG-Workflows.
Visuelles RAG: Integration von Computer Vision#
Während RAG traditionell textbasiert ist, hat der Aufstieg des multimodalen Lernens zu „visuellem RAG“ geführt. In diesem Szenario dienen Computer-Vision-Modelle als Abrufmechanismus. Sie analysieren Bilder oder Videostreams, um strukturierte Textdaten zu extrahieren – etwa Objektnamen, Anzahlen oder Aktivitäten –, die anschließend einem LLM zugeführt werden, um Fragen zur visuellen Szene zu beantworten.
Beispielsweise kann ein Entwickler YOLO26 verwenden, um Objekte in einem Bild zu erkennen, und diese Objektliste an ein Textmodell übergeben, das daraus einen beschreibenden Bericht erstellt.
from ultralytics import YOLO
# Load the YOLO26 model for state-of-the-art detection
model = YOLO("yolo26n.pt")
# Perform inference to 'retrieve' visual facts from an image
results = model("https://ultralytics.com/images/bus.jpg")
# Extract class names to build a text context for an LLM
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
context_string = f"The scene contains: {', '.join(detected_classes)}."
print(context_string)
# Output example: "The scene contains: bus, person, person, person."Anwendungen in der Praxis#
RAG verändert Branchen, indem es KI-Agenten ermöglicht, sicher auf proprietäre oder Echtzeitdaten zuzugreifen.
- Unternehmenswissensbasen: Unternehmen verwenden RAG, um interne Chatbots zu erstellen, die Fragen von Mitarbeitern zu Personalrichtlinien oder technischer Dokumentation beantworten. Durch die Verbindung eines LLM mit einem laufend aktualisierten Dokumentenarchiv vermeidet das System die Bereitstellung veralteter Richtlinieninformationen. Weitere Informationen zu Implementierungen in Unternehmen findest du in der Übersicht von Google Cloud zu RAG in Vertex AI.
- Klinische Entscheidungsunterstützung: Im Bereich KI im Gesundheitswesen können RAG-Systeme die Krankengeschichte eines Patienten und aktuelle medizinische Forschungsarbeiten abrufen, um Ärzte bei der Diagnose zu unterstützen. Dadurch berücksichtigt die Beratung die neuesten klinischen Studien.
- Intelligente Einzelhandelsassistenten: Anwendungen mit KI im Einzelhandel nutzen RAG, um aktuelle Bestandsdatenbanken zu prüfen. Wenn ein Kunde einen Chatbot fragt: „Haben Sie diese Laufschuhe in Größe 10?“, ruft das Modell vor der Antwort die aktuellen Lagerbestände ab und verhindert so Frustration durch nicht verfügbare Artikel.
RAG vs. Feinabstimmung#
Es ist wichtig, RAG von der Feinabstimmung zu unterscheiden, da beide unterschiedliche Probleme lösen.
- RAG (Retrieval-Augmented Generation): Am besten geeignet für den Zugriff auf dynamische, häufig aktualisierte Daten, etwa Aktienkurse oder Nachrichten, sowie auf private Daten, die nicht im öffentlichen Trainingsdatensatz enthalten sind. Der Schwerpunkt liegt darauf, zur Laufzeit neue Informationen bereitzustellen.
- Feinabstimmung: Am besten geeignet, um das Verhalten, den Stil oder die Terminologie des Modells anzupassen. Dabei werden die Modellgewichte anhand eines spezifischen Datensatzes aktualisiert. Die Feinabstimmung hilft einem Modell zwar dabei, ein bestimmtes Sprachmuster zu erlernen, etwa medizinische Fachsprache, verschafft ihm jedoch keinen Zugriff auf Fakten in Echtzeit. Informationen zu Entscheidungsgrundlagen findest du im Leitfaden von OpenAI zum Vergleich von Feinabstimmung und RAG.
Verwandte Konzepte#
- LangChain: Ein beliebtes Open-Source-Framework, das speziell dafür entwickelt wurde, die Erstellung von RAG-Anwendungen zu vereinfachen, indem es Retriever und LLMs miteinander verkettet.
- Wissensgraph: Eine strukturierte Möglichkeit zur Darstellung von Daten, die als Abrufquelle verwendet werden kann und kontextreichere Beziehungen bietet als einfache Vektorähnlichkeit.
- Prompt Engineering: Die Kunst, Eingaben zu formulieren, die das Modell anleiten. RAG ist im Wesentlichen eine automatisierte Form des Prompt Engineering, bei der der „Prompt“ programmgesteuert mit abgerufenen Daten angereichert wird.
- Ultralytics Platform: Während RAG die Seite der Textgenerierung übernimmt, sind Plattformen wie diese unerlässlich für die Verwaltung der Datenvorverarbeitung und des Trainings der Vision-Modelle, die visuelle Daten in multimodale RAG-Pipelines einspeisen.









