Contextual Retrieval
Scopri in che modo il recupero contestuale migliora il RAG con blocchi consapevoli dei documenti, ricerca ibrida e reranking, ed esplora Ultralytics YOLO26 per il contesto visivo multimodale.
Il retrieval contestuale è una tecnica di pre-elaborazione che migliora la retrieval-augmented generation (RAG) aggiungendo una breve spiegazione specifica per documento a ogni chunk di dati prima dell'indicizzazione. Introdotto nella guida di Anthropic al retrieval contestuale del 2024, aiuta i sistemi di ricerca a comprendere dove appartenga un passaggio altrimenti ambiguo, migliorando le evidenze fornite a un large language model. (anthropic.com)
Link to this sectionCome funziona il Retrieval Contestuale#
La RAG standard suddivide i documenti in chunk e li converte in embeddings. Tuttavia, un chunk come "i ricavi sono aumentati del 3%" potrebbe omettere l'azienda, il periodo di riferimento e il tipo di documento. Il retrieval contestuale utilizza il documento completo per generare un prefisso conciso, come "Questo passaggio descrive i risultati finanziari del Q2 2025 di ACME", prima di indicizzare il testo combinato.
Un flusso di lavoro tipico include:
- Semantic Chunking: Dividi i documenti in passaggi coerenti che rientrano nei limiti di recupero e del modello. Lo scopo principale del chunking è rendere ricercabili grandi fonti senza superare il context window del modello.
- Generazione del Contesto: Usa un modello per riassumere la relazione di ciascun chunk con la sua origine, seguendo un processo simile al cookbook per embedding contestuali di Claude.
- Hybrid Search: Indicizza i chunk contestualizzati con vettori densi e metodi lessicali come il ranking per parole chiave BM25.
- Reranking: Riordina i candidati recuperati utilizzando confronti più approfonditi tra query e chunk prima di inviare le migliori evidenze al generatore.
Anthropic ha riferito che gli embedding contestuali combinati con il BM25 contestuale hanno ridotto il tasso di fallimento del recupero nella top-20 del 49%, mentre l'aggiunta del reranking ha prodotto una riduzione del 67% nei suoi test. I risultati variano a seconda del dataset, quindi queste cifre vanno trattate come benchmark piuttosto che come garanzie. (anthropic.com)
Link to this sectionRetrieval Contestuale nella Computer Vision#
Nella multimodal RAG, il contesto del documento può includere oggetti rilevati, didascalie di immagini, timestamp, posizioni delle telecamere o eventi video circostanti. L'esempio seguente utilizza Ultralytics YOLO26 per creare un contesto ricercabile per un'immagine:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls.tolist()]
context = f"Street-scene image containing: {', '.join(labels)}."
print(context)Il testo generato può essere anteposto alla didascalia di un'immagine o a un record di metadati prima dell'embedding. Gli sviluppatori possono esplorare i relativi flussi di lavoro di previsione YOLO e la ricerca di somiglianza visiva.
Link to this sectionApplicazioni nel mondo reale#
- Ricerca Aziendale e Legale: Gli assistenti di policy preservano i nomi dei documenti, le date, i reparti e le relazioni tra clausole, riducendo le risposte fuorvianti provenienti da passaggi isolati.
- Sistemi di Manutenzione Visiva: I macchinari rilevati, i tipi di difetti e le posizioni degli impianti contestualizzano le immagini prima che il sistema recuperi i manuali di riparazione o i record di ispezione.
- Istruzione Personalizzata: Gli agenti di apprendimento possono combinare il dialogo dello studente con i log delle attività per recuperare una guida pertinente al compito attuale del learner.
Link to this sectionTecniche Correlate e Migliori Pratiche#
Il retrieval contestuale differisce dalla context engineering, che gestisce tutte le informazioni fornite a un modello in fase di esecuzione. Differisce inoltre dalla ricerca sul late chunking, che effettua l'embedding di un documento completo prima di raggruppare le rappresentazioni dei token in chunk. Una valutazione comparativa del 2025 ha rilevato che il retrieval contestuale è efficace nel preservare la coerenza semantica ma è più esigente dal punto di vista computazionale. (arxiv.org)
Le attuali migliori pratiche includono il test di più dimensioni di chunk, la conservazione dei metadati di origine, la combinazione del recupero denso e basato su parole chiave e la misurazione di recall, precision, groundedness e completezza della risposta con la guida alla valutazione RAG di Microsoft. Nuove ricerche come SAGE precise retrieval prediligono la segmentazione semantica e la selezione dinamica dei chunk, mentre un benchmark di retrieval del 2026 supporta il retrieval ibrido e il neural reranking per documenti complessi contenenti testo e tabelle. I team che sviluppano sistemi di conoscenza visiva possono utilizzare Ultralytics Platform per annotare dataset, addestrare modelli di visione, distribuire endpoint e monitorare i componenti che forniscono un contesto visivo strutturato.






