Agentic RAG
Erkunde Agentic RAG, um AI durch autonomes Schlussfolgern zu erweitern. Erfahre, wie Ultralytics YOLO26 und die Ultralytics Platform intelligente Suche und visuelle Verarbeitung ermöglichen.
Agentic Retrieval-Augmented Generation (Agentic RAG) ist eine fortschrittliche Architektur für künstliche Intelligenz (AI), die herkömmliche Systeme zum Abrufen von Informationen durch die Integration autonomer KI-Agenten verbessert. Während standardmäßige RAG-Pipelines in einer linearen Abfolge aus „Abrufen und Generieren“ arbeiten, befähigt Agentic RAG ein großes Sprachmodell (LLM), als intelligenter Orchestrator zu agieren. Dieser Agent kann den Prompt eines Benutzers selbstständig analysieren, feststellen, ob externe Informationen benötigt werden, mehrere Suchanfragen formulieren, die abgerufenen Daten bewerten und seine Recherche iterativ verfeinern, bis er eine umfassende und präzise Antwort erstellt hat. Durch die Nutzung von Fähigkeiten zum Aufrufen von Funktionen und Verwenden von Werkzeugen leiten diese Systeme Anfragen dynamisch über verschiedene Datenbanken, APIs und Analysewerkzeuge weiter und reduzieren dadurch Halluzinationen in LLMs bei komplexen Problemen mit mehreren Schritten erheblich.
So funktionieren Agentic-RAG-Systeme#
Die zentrale Innovation von Agentic RAG liegt in der Fähigkeit, Schleifen auszuführen und Schlussfolgerungen zu ziehen. Führende Frameworks für agentische KI strukturieren diesen Prozess als dynamische, autonome Arbeitsabläufe:
- Abfrageplanung und Weiterleitung: Der Agent zerlegt komplexe Fragen in kleinere, überschaubare Teilaufgaben und leitet jede davon an das am besten geeignete Werkzeug oder die passende Vektordatenbank weiter.
- Iteratives Abrufen: Anders als beim statischen Abrufen überprüft der Agent die abgerufenen Dokumente. Wenn der Kontext nicht ausreicht, formuliert er seine Suchstrategie neu und führt eine weitere Abfrage aus.
- Werkzeugintegration: Der Agent kann Code schreiben und ausführen, mathematische Berechnungen durchführen oder Modelle für maschinelles Lernen (ML) aufrufen, um spontan neue Daten zu erstellen.
Agentic RAG im Vergleich zu Standard-RAG#
Für die Umsetzung robuster generativer Pipelines ist es entscheidend, Agentic RAG von seinen grundlegenden Konzepten zu unterscheiden:
- Standardmäßige Retrieval-Augmented Generation (RAG): Arbeitet in einem einzigen Durchlauf. Sie ruft Dokumente auf Grundlage semantischer Ähnlichkeit ab und generiert eine Antwort. Mit komplexer Logik, die über mehrere Schritte hinweg die Zusammenführung voneinander getrennter Datenquellen erfordert, kommt sie nur schwer zurecht.
- Agentic RAG: Führt Entscheidungsfindung und Schleifen ein. Der Agent bewertet die Qualität des Abrufvorgangs und kann vor dem Abschluss der Generierung weitere Suchvorgänge oder andere Werkzeuge auslösen.
- Multimodales RAG: Konzentriert sich auf das Abrufen verschiedener Datentypen (Bilder, Text, Video). Agentic RAG kann eine multimodale RAG-Pipeline steuern und entscheiden, wann eine visuelle Datenbank statt eines Textdokuments durchsucht werden soll.
Anwendungen in der Praxis#
Agentic RAG verändert Branchen, indem es anspruchsvolle Recherche- und komplexe Fehlerbehebungsaufgaben automatisiert, die menschliches analytisches Denken nachahmen.
- Synthese von Unternehmenswissen: In Unternehmen könnte ein Agent den Prompt erhalten: „Fasse unsere Leistung im dritten Quartal zusammen und vergleiche sie mit den neuesten Finanzergebnissen unseres wichtigsten Wettbewerbers.“ Der Agent fragt selbstständig interne Finanzdatenbanken ab, führt Echtzeit-Websuchen nach Einreichungen des Wettbewerbers durch, analysiert die Zahlen mit einem Taschenrechnerwerkzeug und erstellt einen umfassenden Berichtsentwurf.
- Autonome Qualitätsprüfung: In der Fertigung kann ein Agent damit beauftragt werden, die Grundursache eines Montagefehlers zu ermitteln. Er kann ein Modell für Computer Vision (CV) aufrufen, um einen Live-Kamerastream zu untersuchen, historische Wartungsprotokolle abfragen und auf Grundlage visueller und textlicher Belege einen Diagnosebericht erstellen.
Integration von Vision-KI in agentische Arbeitsabläufe#
Vision-Modelle dienen Agentic-RAG-Systemen, die mit der physischen Welt interagieren, als leistungsstarke sensorische Werkzeuge. Ein Agent kann beispielsweise Ultralytics YOLO26 verwenden, um dynamisch visuellen Kontext aus einem Bild- oder Videostream abzurufen und Benutzeranfragen zu beantworten. Entwickler können die Datenannotation und das Training dieser individuellen Vision-Werkzeuge mit der Ultralytics Platform verwalten.
Das folgende Python-Beispiel zeigt, wie ein KI-Agent Ultralytics YOLO26 programmgesteuert aufrufen kann, um strukturierte Beobachtungen aus einem Bild zu extrahieren und dabei sachlichen Kontext für seinen nächsten Schlussfolgerungsschritt zu sammeln.
from ultralytics import YOLO
# Initialize YOLO26 for the agent's visual retrieval tool
model = YOLO("yolo26n.pt")
# The agent invokes the model on an image to gather visual facts
results = model("https://ultralytics.com/images/bus.jpg")
# The agent parses the detected objects to formulate its next query or action
visual_context = [model.names[int(c)] for c in results[0].boxes.cls]
print(f"Agent Observation: I currently see {', '.join(visual_context)}.")Indem leistungsfähige Vision-Modelle mit Schlussfolgerungsmodulen verbunden werden, schließt Agentic RAG die Lücke zwischen statischem Wissensabruf und dynamischer, realer räumlicher Intelligenz. Einen tieferen Einblick in die sich wandelnde Landschaft autonomer Systeme bietet der Stanford AI Index Report, der agentische Fähigkeiten umfassend dokumentiert.









