Context Rot
Context Rot bezeichnet den Verlust an Zuverlässigkeit, wenn ein LLM mehr Kontext erhält, als es nutzen kann, Fakten übersieht oder veralteten Anweisungen folgt. Behandelt Möglichkeiten, das Problem einzudämmen.
Kontextverfall ist der allmähliche Verlust an Zuverlässigkeit, der eintritt, wenn ein KI-Modell mehr Kontext erhält, als es wirksam nutzen kann. Selbst wenn ein angegebenes Kontextfenster technisch Hunderttausende von Token aufnehmen kann, übersieht ein großes Sprachmodell möglicherweise relevante Fakten, befolgt veraltete Anweisungen oder schlussfolgert weniger genau, wenn die Eingabe wächst. Eine Chroma-Studie zum Kontextverfall von 2025 beobachtete diese uneinheitliche Leistung bei 18 Modellen und mehreren kontrollierten Aufgaben.
Wie Kontextverfall entsteht#
Lange Eingaben stellen höhere Anforderungen an den Aufmerksamkeitsmechanismus des Modells. Relevante Belege müssen mit wiederholten Anweisungen, irrelevanten Dokumenten, Tool-Ausgaben und früheren Gesprächsbeiträgen konkurrieren. Die Position im Kontext, semantische Ähnlichkeit, widersprüchliche Fakten und die Komplexität der Aufgabe können beeinflussen, welche Informationen das Modell nutzt.
Der RULER-Benchmark für lange Kontexte von 2024 ergab, dass Modelle, die bei einfacher Informationssuche gute Ergebnisse erzielen, bei zunehmender Sequenzlänge und Aufgabenkomplexität häufig schlechter abschneiden. Der NoLiMa-Benchmark von 2025 zeigte größere Leistungseinbußen, wenn zum Finden einer Antwort semantisches Schlussfolgern statt des Abgleichs identischer Wörter erforderlich war. Es gibt daher keine allgemeingültige Tokenanzahl – auch nicht für Gemini-Modelle –, ab der Kontextverfall beginnt. Der Schwellenwert hängt vom Modell, der Prompt-Struktur und der Aufgabe ab.
Praxisbeispiele#
- Kundendienstassistenten: Ein Chatbot, dem Tickets aus mehreren Jahren vorgelegt werden, priorisiert möglicherweise eine veraltete Richtlinie oder übersieht eine aktuelle Kontoänderung. Untersuchungen mit dem LongMemEval-Benchmark für Konversationsgedächtnis und dem multimodalen LoCoMo-Benchmark zeigen, dass das Extrahieren, Aktualisieren und Auswerten langer Gesprächsverläufe weiterhin eine Herausforderung ist.
- Agenten für visuelle Inspektion: Ein Vision-Language-Modell, das eine Fabrik überwacht, wird möglicherweise unzuverlässiger, wenn jedes Bild, jede Erkennung und jedes Wartungsprotokoll in einen einzigen Prompt aufgenommen wird. Ein besserer Workflow verwendet Ultralytics YOLO26, um prägnante visuelle Fakten zu extrahieren, bevor das Sprachmodell Schlussfolgerungen zieht.
- Programmieragenten: Ein vollständiges Repository, jede Tool-Definition und der gesamte Terminalverlauf können das aktuelle Ziel verschleiern. Anthropics Leitfaden zum Context Engineering empfiehlt, den Kontext gezielt zusammenzustellen, während der Agent-Skills-Ansatz detaillierte Ressourcen nur bei Bedarf lädt.
Dieser YOLO-Vorhersage-Workflow zeigt, wie sich rohe Erkennungen in einen kompakten, strukturierten Kontext umwandeln lassen:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)So lässt sich Kontextverfall verringern#
- Nur relevante Belege abrufen: Semantische Segmentierung und einen Reranker verwenden, statt alle verfügbaren Dokumente zu übermitteln.
- Ältere Informationen komprimieren: Ersetze lange Verläufe durch überprüfte Zusammenfassungen, Entscheidungen und noch offene Aufgaben. Forschungsergebnisse legen nahe, dass eine größere Eingabelänge die Leistung auch nach erfolgreichem Abruf beeinträchtigen kann.
- Stabile Präfixe beibehalten: Prompt-Caching von OpenAI und Kontext-Caching von Gemini können die Kosten wiederholter Verarbeitung senken, doch Caching allein verbessert die Kontextqualität nicht.
- Gleitende Fenster verwenden: Google empfiehlt die Komprimierung des Kontextfensters für lange laufende Sitzungen, wobei aktuelle Informationen erhalten bleiben und ältere Token entfernt werden.
- Mit realistischen Kontextlängen evaluieren: Modellüberwachung einsetzen und kontrollierte Tests mit dem offenen Toolkit zum Kontextverfall reproduzieren.
Kontextverfall unterscheidet sich von Halluzinationen, also nicht belegten Ausgaben, von katastrophalem Vergessen, bei dem sich das Modellwissen während des Trainings verändert, und von Datenverschiebungen, die auf veränderte Eingaben im Produktivbetrieb zurückgehen. Kontextverfall ist in erster Linie ein Fehler bei der Auswahl und Verarbeitung von Kontext zur Inferenzzeit. Die wichtigste Gegenmaßnahme ist daher ein wirksames Kontext-Engineering.










