Semantic Chunking
Scopri come il chunking semantico preserva il contesto dei dati per aumentare l'accuratezza dell'AI e del RAG. Scopri come estrarre chunk visivi usando Ultralytics YOLO26.
La segmentazione semantica è una tecnica avanzata di pre-elaborazione dei dati utilizzata nell'apprendimento automatico (ML) e nell'intelligenza artificiale (AI) per suddividere grandi dataset in segmenti più piccoli e significativi. Se ti stai chiedendo "che cos'è la segmentazione" nel contesto dell'AI, si tratta del processo di suddivisione di lunghe sequenze di dati non strutturati—come documenti, video o audio—in parti o segmenti gestibili. La definizione standard di segmentazione prevede spesso la suddivisione dei dati in base a un numero fisso di caratteri o a un intervallo di tempo. Tuttavia, la "segmentazione basata sul significato", o segmentazione semantica, va oltre analizzando il contesto e raggruppando insieme le informazioni correlate. In questo modo il messaggio principale rimane intatto, evitando la perdita di contesto che affligge frequentemente i metodi di suddivisione arbitraria.
Come funziona la segmentazione semantica?#
Per capire come eseguire la segmentazione semantica, è utile esaminarne il ruolo nelle moderne pipeline generative. Quindi, che cos'è la segmentazione semantica nel RAG? Quando si preparano i dati per un database vettoriale, un modello di embedding analizza le frasi adiacenti o gli elementi visivi e ne calcola la relazione. Utilizzando metriche statistiche come la similarità coseno, il sistema identifica i punti in cui cambia l'argomento—spesso chiamati punti di interruzione—e divide i dati in quei punti. In questo modo, i dati recuperati da un modello linguistico di grandi dimensioni (LLM) durante una query sono organizzati in segmenti contenenti pensieri completi e coerenti, migliorando drasticamente l'accuratezza della risposta generata. Studi recenti su RAPTOR e il clustering adattivo dei grafi evidenziano come questa strategia sensibile al contesto superi la suddivisione in dimensioni fisse.
Segmentazione semantica nella computer vision#
Sebbene tradizionalmente associata all'elaborazione del linguaggio naturale (NLP), la segmentazione semantica è molto rilevante nella computer vision e nell'AI multimodale. Nell'analisi dei documenti, ad esempio, un segmento semantico visivo può mantenere insieme un grafico e la relativa didascalia esplicativa, invece di separarli in base a rigidi limiti di pagina. I provider cloud avanzati e gli strumenti API offrono configurazioni specializzate per la segmentazione semantica per gestire questi tipi di dati complessi.
Gli sviluppatori possono sfruttare il modello Ultralytics YOLO26 per automatizzare l'estrazione di questi segmenti visivi. Rilevando gli oggetti all'interno di un'immagine o di un video, puoi creare segmenti localizzati di significato che rappresentano i contenuti principali della scena.
from ultralytics import YOLO
# Load an Ultralytics YOLO26 model to extract visual semantics
model = YOLO("yolo26n.pt")
# Run inference to detect objects within a visual scene
results = model("scene.jpg")
# Group detected object classes to form a semantic visual chunk
visual_chunk = [model.names[int(cls)] for cls in results[0].boxes.cls]
print(f"Semantic visual chunk elements: {visual_chunk}")Applicazioni nel mondo reale#
La segmentazione semantica risolve problematiche critiche in diversi workflow di AI. Ecco due esempi concreti:
- RAG multimodale per l'AI dei documenti: Quando si analizzano PDF complessi, come i rapporti finanziari, la segmentazione visiva garantisce che i riquadri di delimitazione intorno alle tabelle vengano raggruppati con i relativi riepiloghi testuali. In questo modo gli assistenti AI possono rispondere accuratamente a domande molto specifiche senza perdere il contesto numerico.
- Riepilogo video automatizzato: Nei sistemi di sicurezza e sorveglianza, i flussi video continui vengono suddivisi semanticamente in base agli eventi rilevati—come l'ingresso di una persona in un'area riservata. Utilizzando il tracking degli oggetti, il sistema raggruppa i fotogrammi pertinenti in un clip video utilizzabile, invece di restituire una porzione casuale di 10 secondi. I team che gestiscono questi enormi dataset spesso si affidano alla Ultralytics Platform per annotare, addestrare e distribuire senza problemi pipeline complesse basate sugli eventi.
Concetti correlati#
È importante distinguere questa tecnica da termini di AI simili:
- Segmentazione delle azioni: Mentre la segmentazione semantica raggruppa i dati in base al significato per ottimizzare il recupero, la segmentazione delle azioni raggruppa sequenze di movimenti fisici, come la traiettoria del braccio robotico, in singole azioni eseguibili nella robotica.
- Ricerca semantica: La segmentazione semantica è la fase essenziale di preparazione dei dati che rende possibile un recupero accurato delle informazioni, mentre la ricerca semantica è il processo effettivo di interrogazione che recupera i segmenti preparati in base all'intento dell'utente.









