Contextual Retrieval
Erfahre, wie kontextbezogenes Retrieval RAG mit dokumentbezogenen Abschnitten, hybrider Suche und Reranking verbessert – und entdecke Ultralytics YOLO26 für multimodalen visuellen Kontext.
Kontextuelles Retrieval ist eine Vorverarbeitungstechnik, die die abrufgestützte Generierung (RAG) verbessert, indem jedem Datenabschnitt vor der Indexierung eine kurze, dokumentspezifische Erklärung hinzugefügt wird. Die Technik wurde im Leitfaden von Anthropic zum kontextuellen Retrieval von 2024 vorgestellt und hilft Suchsystemen zu verstehen, wo ein ansonsten mehrdeutiger Abschnitt einzuordnen ist. Dadurch wird die Evidenz verbessert, die einem großen Sprachmodell bereitgestellt wird. (anthropic.com)
Funktionsweise des kontextuellen Retrievals#
Standard-RAG teilt Dokumente in Abschnitte auf und wandelt sie in Embeddings um. Ein Abschnitt wie „Der Umsatz stieg um 3 %“ enthält jedoch möglicherweise keine Angaben zum Unternehmen, Berichtszeitraum oder Dokumenttyp. Beim kontextuellen Retrieval wird das vollständige Dokument verwendet, um vor der Indexierung des kombinierten Textes ein knappes Präfix zu erzeugen, etwa „Dieser Abschnitt beschreibt die Finanzergebnisse von ACME für das 2. Quartal 2025.“
Ein typischer Ablauf umfasst:
- Semantisches Chunking: Teile Dokumente in zusammenhängende Abschnitte auf, die in die Grenzen von Retrieval und Modell passen. Der Hauptzweck des Chunkings besteht darin, große Quellen durchsuchbar zu machen, ohne das Kontextfenster des Modells zu überschreiten.
- Kontexterzeugung: Verwende ein Modell, um die Beziehung jedes Abschnitts zu seiner Quelle zusammenzufassen, nach einem Verfahren wie im Kochbuch zu kontextuellen Embeddings für Claude.
- Hybride Suche: Indexiere kontextualisierte Abschnitte mit dichten Vektoren und lexikalischen Verfahren wie dem BM25-Schlüsselwort-Ranking.
- Neuranking: Ordne die abgerufenen Kandidaten mithilfe detaillierterer Vergleiche zwischen Anfrage und Abschnitt neu, bevor du die beste Evidenz an das Generierungsmodell übergibst.
Anthropic berichtete, dass kontextuelle Embeddings in Kombination mit kontextuellem BM25 die Fehlerquote beim Abruf der 20 besten Ergebnisse um 49 % senkten, während Neuranking in den Tests eine Reduktion um 67 % erzielte. Die Ergebnisse variieren je nach Datensatz, daher sollten diese Zahlen eher als Vergleichswerte denn als Garantien betrachtet werden. (anthropic.com)
Kontextuelles Retrieval in der Computer Vision#
Bei multimodalem RAG kann der Dokumentkontext erkannte Objekte, Bildbeschreibungen, Zeitstempel, Kamerastandorte oder umgebende Videosequenzen umfassen. Das folgende Beispiel verwendet Ultralytics YOLO26, um durchsuchbaren Kontext für ein Bild zu erstellen:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls.tolist()]
context = f"Street-scene image containing: {', '.join(labels)}."
print(context)Der erzeugte Text kann vor der Erstellung des Embeddings einer Bildbeschreibung oder einem Metadatensatz vorangestellt werden. Entwickler können verwandte YOLO-Abläufe für Vorhersagen und die Suche nach visueller Ähnlichkeit erkunden.
Anwendungen in der Praxis#
- Unternehmens- und Rechtssuche: Assistenten für Richtlinien bewahren Dokumentnamen, Daten, Abteilungen und Beziehungen zwischen Klauseln, wodurch irreführende Antworten aus isolierten Abschnitten reduziert werden.
- Systeme für die visuelle Instandhaltung: Erkannte Maschinen, Fehlerarten und Anlagenstandorte liefern Kontext für Bilder, bevor das System Reparaturhandbücher oder Prüfaufzeichnungen abruft.
- Personalisierte Bildung: Lernagenten können den Dialog mit Lernenden mit Aktivitätsprotokollen kombinieren, um für die aktuelle Aufgabe der lernenden Person relevante Anleitungen abzurufen.
Verwandte Techniken und bewährte Verfahren#
Kontextuelles Retrieval unterscheidet sich vom Kontext-Engineering, bei dem sämtliche Informationen verwaltet werden, die einem Modell zur Laufzeit bereitgestellt werden. Es unterscheidet sich auch von der Forschung zum späten Chunking, bei der zunächst ein vollständiges Dokument als Embedding abgebildet wird, bevor Token-Repräsentationen zu Abschnitten zusammengefasst werden. Eine vergleichende Untersuchung von 2025 ergab, dass kontextuelles Retrieval semantische Kohärenz effektiv bewahrt, aber rechenintensiver ist. (arxiv.org)
Zu den aktuellen bewährten Verfahren gehören das Testen mehrerer Abschnittsgrößen, die Beibehaltung von Quellmetadaten, die Kombination aus dichtem und schlüsselwortbasiertem Retrieval sowie die Messung von Trefferquote, Genauigkeit, Faktenfundierung und Vollständigkeit der Antworten mithilfe der Leitlinien von Microsoft zur Bewertung von RAG. Neuere Forschung wie SAGE Precise Retrieval bevorzugt semantische Segmentierung und eine dynamische Auswahl von Abschnitten, während ein Retrieval-Benchmark von 2026 hybrides Retrieval und neuronales Neuranking für komplexe Text- und Tabellendokumente unterstützt. Teams, die visuelle Wissenssysteme entwickeln, können die Ultralytics Platform verwenden, um Datensätze zu annotieren, Bildverarbeitungsmodelle zu trainieren, Endpunkte bereitzustellen und die Komponenten zu überwachen, die strukturierten visuellen Kontext liefern.






