Context Rot
Scopri cos'è il context rot, perché gli input AI lunghi riducono l'affidabilità e come i flussi di lavoro di retrieval, compressione e YOLO26 migliorano il context engineering.
Il context rot è la graduale perdita di affidabilità che si verifica quando un modello di IA riceve più contesto di quanto possa utilizzare efficacemente. Anche quando una finestra di contesto pubblicizzata può tecnicamente contenere centinaia di migliaia di token, un modello linguistico di grandi dimensioni potrebbe trascurare fatti rilevanti, seguire istruzioni obsolete o ragionare con minore precisione man mano che l'input cresce. Uno studio sul context rot di Chroma del 2025 ha osservato questa prestazione non uniforme su 18 modelli e diverse attività controllate. (trychroma.com)
Come si verifica il Context Rot#
Gli input lunghi pongono maggiori richieste al meccanismo di attenzione del modello. Prove importanti devono competere con istruzioni ripetute, documenti irrilevanti, output di strumenti e turni di conversazione più vecchi. La posizione del contesto, la somiglianza semantica, fatti in conflitto e la complessità dell'attività possono influenzare ciò che il modello utilizza.
Il benchmark per contesti lunghi RULER del 2024 ha riscontrato che i modelli con buone prestazioni sul recupero semplice spesso diminuivano man mano che la lunghezza della sequenza e la complessità dell'attività aumentavano. Il benchmark NoLiMa del 2025 ha rivelato cali maggiori quando la ricerca di una risposta richiedeva un ragionamento semantico anziché la corrispondenza di parole identiche. Non esiste quindi un conteggio universale dei token, compresi i modelli Gemini, in cui inizia il context rot; la soglia dipende dal modello, dalla struttura del prompt e dall'attività. (arxiv.org)
Esempi dal mondo reale#
- Assistenti di supporto clienti: A un chatbot a cui sono stati dati anni di ticket potrebbe dare priorità a una politica obsoleta o perdere un recente aggiornamento dell'account. La ricerca che utilizza la memoria conversazionale LongMemEval e il benchmark LoCoMo multimodale mostra che estrarre, aggiornare e ragionare su lunghe cronologie di interazione rimane impegnativo. (arxiv.org)
- Agenti di ispezione visiva: Un modello di visione-linguaggio che monitora una fabbrica può diventare meno affidabile se ogni fotogramma, rilevamento e registro di manutenzione viene inserito in un unico prompt. Un flusso di lavoro migliore utilizza Ultralytics YOLO26 per estrarre fatti visivi concisi prima del ragionamento del modello linguistico.
- Agenti di programmazione: Caricare un intero repository, ogni definizione di strumento e la cronologia completa del terminale può oscurare l'obiettivo attuale. La guida all'ingegneria del contesto di Anthropic consiglia di curare il contesto, mentre il suo approccio con le competenze degli agenti carica risorse dettagliate solo quando necessario. (anthropic.com)
Questo flusso di lavoro di previsione YOLO dimostra la conversione dei rilevamenti grezzi in un contesto compatto e strutturato:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Come ridurre il Context Rot#
- Recupera solo le prove rilevanti: Utilizza la suddivisione in chunk semantici e un reranker anziché inviare ogni documento disponibile.
- Comprimi le informazioni meno recenti: Sostituisci le lunghe cronologie con riassunti verificati, decisioni e attività irrisolte. La ricerca suggerisce che la lunghezza dell'input può ridurre le prestazioni anche dopo un recupero riuscito. (arxiv.org)
- Preserva i prefissi stabili: La memorizzazione nella cache dei prompt di OpenAI e la memorizzazione nella cache del contesto di Gemini possono ridurre i costi di elaborazione ripetuta, sebbene la sola memorizzazione nella cache non migliori la qualità del contesto.
- Utilizza finestre scorrevoli: Google consiglia la compressione della finestra di contesto per lunghe sessioni dal vivo, conservando le informazioni recenti ed eliminando i token meno recenti. (ai.google.dev)
- Valuta a lunghezze realistiche: Applica il monitoraggio del modello e riproduci test controllati con il toolkit aperto per il context rot.
Il context rot differisce dall'allucinazione, che è un output non supportato; dalla dimenticanza catastrofica, che modifica la conoscenza del modello durante l'addestramento; e dalla deriva dei dati, che riflette input di produzione mutevoli. Il context rot è principalmente un errore in fase di inferenza nella selezione del contesto e nel ragionamento, rendendo l'ingegneria del contesto efficace la sua difesa principale.






