Context Rot
La dégradation du contexte correspond à la perte de fiabilité d’un LLM lorsqu’il reçoit plus de contexte qu’il ne peut en exploiter, ce qui lui fait manquer des faits ou suivre des consignes obsolètes. Découvre comment la limiter.
La dégradation du contexte est la perte progressive de fiabilité qui survient lorsqu’un modèle d’IA reçoit plus de contexte qu’il ne peut en exploiter efficacement. Même si une fenêtre de contexte annoncée peut techniquement contenir des centaines de milliers de tokens, un grand modèle de langage peut négliger des faits pertinents, suivre des instructions obsolètes ou raisonner moins précisément à mesure que l’entrée s’allonge. Une étude de 2025 de Chroma sur la dégradation du contexte a observé ces performances non uniformes sur 18 modèles et plusieurs tâches contrôlées.
Comment se produit la dégradation du contexte#
Les longues entrées sollicitent davantage le mécanisme d’attention du modèle. Les éléments importants doivent rivaliser avec les instructions répétées, les documents non pertinents, les sorties d’outils et les tours de conversation antérieurs. La position dans le contexte, la similarité sémantique, les faits contradictoires et la complexité de la tâche peuvent tous influer sur les éléments utilisés par le modèle.
Le benchmark RULER de 2024 sur les longs contextes a constaté que les modèles performants en récupération simple déclinaient souvent lorsque la longueur des séquences et la complexité des tâches augmentaient. Le benchmark NoLiMa de 2025 a révélé des baisses plus importantes lorsque trouver une réponse exigeait un raisonnement sémantique plutôt que la correspondance de mots identiques. Il n’existe donc pas de nombre universel de tokens — y compris pour les modèles Gemini — à partir duquel commence la dégradation du contexte : le seuil dépend du modèle, de la structure du prompt et de la tâche.
Exemples concrets#
- Assistants du service client : Un chatbot alimenté par plusieurs années de tickets peut privilégier une politique obsolète ou manquer une récente mise à jour de compte. Les recherches fondées sur la mémoire conversationnelle LongMemEval et le benchmark multimodal LoCoMo montrent que l’extraction, la mise à jour et l’exploitation de longs historiques d’interaction pour le raisonnement restent difficiles.
- Agents d’inspection visuelle : Un modèle vision-langage qui surveille une usine peut devenir moins fiable si chaque image, chaque détection et chaque journal de maintenance sont inclus dans une seule invite. Un meilleur flux de travail utilise Ultralytics YOLO26 pour extraire des éléments visuels concis avant le raisonnement du modèle de langage.
- Agents de programmation : Charger tout un dépôt, chaque définition d’outil et l’historique complet du terminal peut masquer l’objectif actuel. Les recommandations d’Anthropic sur l’ingénierie du contexte préconisent de sélectionner soigneusement le contexte, tandis que son approche Agent Skills ne charge les ressources détaillées qu’en cas de besoin.
Ce flux de travail YOLO predict montre comment convertir des détections brutes en contexte compact et structuré :
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Comment réduire la dégradation du contexte#
- Ne récupérer que les éléments pertinents : Utilise le découpage sémantique et un modèle de reclassement plutôt que d’envoyer tous les documents disponibles.
- Compresse les informations anciennes : Remplace les longs historiques par des résumés vérifiés, des décisions et des tâches en suspens. Les recherches suggèrent que la longueur de l’entrée peut réduire les performances même après une récupération réussie.
- Préserver les préfixes stables : La mise en cache des invites d’OpenAI et la mise en cache du contexte de Gemini peuvent réduire les coûts de traitement répété, même si la mise en cache seule n’améliore pas la qualité du contexte.
- Utilise des fenêtres glissantes : Google recommande la compression de la fenêtre de contexte pour les longues sessions en direct, en conservant les informations récentes et en évacuant les tokens plus anciens.
- Évaluer avec des longueurs réalistes : Applique la surveillance des modèles et reproduis des tests contrôlés à l’aide de la boîte à outils ouverte de dégradation du contexte.
La dégradation du contexte diffère de l’hallucination, qui produit une sortie non étayée ; de l’oubli catastrophique, qui modifie les connaissances du modèle pendant l’entraînement ; et de la dérive des données, qui reflète l’évolution des données de production. La dégradation du contexte est principalement une défaillance, au moment de l’inférence, de la sélection du contexte et du raisonnement ; l’ingénierie du contexte constitue donc sa principale défense.










