Context Rot
Il deterioramento del contesto è la perdita di affidabilità che si verifica quando un LLM riceve più contesto di quanto possa usare, trascurando fatti o seguendo istruzioni non più attuali. Ne tratta i metodi per limitarlo.
Il deterioramento del contesto è la graduale perdita di affidabilità che si verifica quando un modello di IA riceve più contesto di quanto riesca a usare efficacemente. Anche quando la finestra di contesto dichiarata può contenere tecnicamente centinaia di migliaia di token, un modello linguistico di grandi dimensioni può trascurare fatti rilevanti, seguire istruzioni obsolete o ragionare con meno precisione man mano che l’input cresce. Uno studio di Chroma del 2025 sul deterioramento del contesto ha osservato prestazioni non uniformi su 18 modelli e diverse attività controllate.
Come si verifica il deterioramento del contesto#
Gli input lunghi sollecitano maggiormente il meccanismo di attenzione del modello. Le prove importanti devono competere con istruzioni ripetute, documenti irrilevanti, output degli strumenti e turni precedenti della conversazione. La posizione nel contesto, la somiglianza semantica, i fatti contraddittori e la complessità del compito possono influire sulle informazioni usate dal modello.
Il benchmark RULER del 2024 sui contesti lunghi ha rilevato che i modelli con buone prestazioni nei semplici compiti di recupero spesso peggioravano con l’aumento della lunghezza delle sequenze e della complessità delle attività. Il benchmark NoLiMa del 2025 ha evidenziato cali maggiori quando per trovare una risposta serviva ragionamento semantico, anziché individuare parole identiche. Non esiste quindi un numero universale di token, nemmeno per i modelli Gemini, oltre il quale inizi il deterioramento del contesto: la soglia dipende dal modello, dalla struttura del prompt e dall’attività.
Esempi nel mondo reale#
- Assistenti per l’assistenza clienti: un chatbot a cui vengono fornite le richieste degli ultimi anni potrebbe dare priorità a una politica obsoleta o non rilevare un recente aggiornamento dell’account. La ricerca che utilizza la memoria conversazionale LongMemEval e il benchmark multimodale LoCoMo mostra che estrarre, aggiornare e ragionare su cronologie di interazione lunghe resta difficile.
- Agenti per l'ispezione visiva: un modello visione-linguaggio che monitora una fabbrica può diventare meno affidabile se ogni fotogramma, rilevamento e registro di manutenzione viene inserito in un unico prompt. Un flusso di lavoro migliore usa Ultralytics YOLO26 per estrarre fatti visivi concisi prima del ragionamento del modello linguistico.
- Agenti di programmazione: caricare un intero repository, tutte le definizioni degli strumenti e la cronologia completa del terminale può rendere meno evidente l’obiettivo attuale. Le indicazioni di Anthropic sull’ingegneria del contesto raccomandano di selezionare con cura il contesto, mentre il suo approccio Agent Skills carica risorse dettagliate solo quando servono.
Questo flusso di lavoro di predict con YOLO mostra come convertire i rilevamenti grezzi in un contesto compatto e strutturato:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Come ridurre il deterioramento del contesto#
- Recupera solo le prove pertinenti: usa il chunking semantico e un reranker invece di inviare tutti i documenti disponibili.
- Comprimi le informazioni meno recenti: sostituisci le cronologie lunghe con riepiloghi verificati, decisioni e attività irrisolte. La ricerca suggerisce che la lunghezza dell’input può ridurre le prestazioni anche dopo un recupero riuscito.
- Mantieni stabili i prefissi: la memorizzazione nella cache dei prompt di OpenAI e la memorizzazione nella cache del contesto di Gemini possono ridurre i costi di elaborazione ripetuta, anche se la sola memorizzazione nella cache non migliora la qualità del contesto.
- Usa finestre scorrevoli: Google raccomanda la compressione della finestra di contesto per le sessioni live prolungate, mantenendo le informazioni recenti ed eliminando i token più vecchi.
- Valuta con lunghezze realistiche: applica il monitoraggio dei modelli e riproduci test controllati con il toolkit aperto per il deterioramento del contesto.
Il deterioramento del contesto è diverso dalle allucinazioni, che sono output non supportati; dalla dimenticanza catastrofica, che modifica la conoscenza del modello durante l’addestramento; e dalla deriva dei dati, che riflette i cambiamenti negli input di produzione. Il deterioramento del contesto è principalmente un errore in fase di inferenza nella selezione del contesto e nel ragionamento; la sua difesa principale è quindi una efficace progettazione del contesto.










