Semantic Entropy
Scopri come l'entropia semantica misura l'incertezza nel significato di un LLM, distingue risposte in conflitto e supporta una valutazione dell'IA più sicura e il rilevamento delle allucinazioni.
L'entropia semantica misura quanto un modello di intelligenza artificiale generativa sia incerto riguardo al significato della sua risposta. Invece di trattare ogni variazione di formulazione come un risultato diverso, raggruppa le risposte semanticamente equivalenti e misura quanto ampiamente la probabilità sia distribuita tra i significati risultanti. Se le risposte ripetute esprimono un'idea coerente, l'entropia semantica è bassa. Se supportano diverse idee in conflitto, è alta, indicando che il modello potrebbe non sapere quale risposta sia corretta.
Questa misura è particolarmente rilevante per un large language model (LLM) o un altro sistema che produce linguaggio in forma libera, in cui lo stesso significato può essere espresso attraverso molte sequenze di parole diverse.
Come Funziona l'Entropia Semantica#
L'entropia è una misura generale dell'incertezza in una distribuzione di probabilità: è bassa quando la probabilità si concentra su un risultato ed è alta quando diversi risultati rimangono plausibili. La definizione di entropia del NIST fornisce il concetto teorico-informatico di base. (csrc.nist.gov)
Un flusso di lavoro di entropia semantica segue tipicamente quattro passaggi:
- Genera diverse risposte allo stesso input utilizzando il campionamento.
- Raggruppa le risposte che comunicano lo stesso significato.
- Stima la probabilità di ciascun significato dalla sua frequenza o probabilità di generazione.
- Calcola l'entropia tra quei gruppi semantici.
Ad esempio, "Paris", "The answer is Paris" e "France's capital is Paris" appartengono allo stesso gruppo di significato. "Lyon" appartiene a un altro. L'entropia lessicale potrebbe esagerare l'incertezza trattando tutte e quattro le stringhe come diverse, mentre l'entropia semantica riconosce che le prime tre concordano.
La fase di raggruppamento può utilizzare il giudizio umano, l'implicazione testuale o embedding numerici combinati con una misura di somiglianza come la somiglianza del coseno di scikit-learn.
from collections import Counter
from scipy.stats import entropy
# Equivalent answers have already been assigned the same meaning label.
meaning_labels = [
"Paris",
"Paris",
"Paris",
"Lyon",
"Unknown",
]
counts = Counter(meaning_labels)
probabilities = [count / len(meaning_labels) for count in counts.values()]
score = entropy(probabilities, base=2)
print(f"Semantic entropy: {score:.3f} bits")Questo esempio semplificato utilizza la funzione di entropia di SciPy documentata. In un sistema di produzione, il raggruppamento semantico deve essere convalidato con attenzione poiché un raggruppamento errato può distorcere il punteggio finale.
Concetti correlati e differenze chiave#
L'entropia semantica appartiene al campo più ampio della quantificazione dell'incertezza, ma affronta l'incertezza sui significati anziché solo su etichette, token o previsioni numeriche.
- L'entropia dei token misura l'incertezza sul token successivo o sulla sequenza di token completa. Può assegnare un'alta incertezza a differenze di formulazione innocue.
- L'autocoerenza verifica se generazioni ripetute producono risposte compatibili. L'entropia semantica estende questa idea rappresentando la distribuzione relativa di diversi significati.
- La fiducia è solitamente un punteggio associato a una previsione. L'entropia semantica invece confronta più generazioni possibili. Né l'una né l'altra dovrebbero essere interpretate automaticamente come una probabilità calibrata; la calibrazione deve essere valutata rispetto ai risultati osservati. (scikit-learn.org)
- L'allucinazione negli LLM è un errore in cui il contenuto generato è falso, non supportato o fuorviante. L'entropia semantica è un segnale di avvertimento, non l'errore in sé. Un'alta entropia può rivelare risposte contrastanti, mentre una bassa entropia non dimostra la correttezza poiché un modello può ripetere costantemente la stessa falsa affermazione. Le allucinazioni possono quindi rimanere fiduciose e internamente coerenti. (openai.com)
- La segmentazione semantica assegna una classe a ciascun pixel dell'immagine. Nonostante condivida la parola "semantica", è un'attività di computer vision ed è indipendente dall'entropia sui significati generati.
Applicazioni nel mondo reale#
Assistenti di risposta alle domande: Un assistente di supporto clienti può campionare diverse risposte prima di rispondere. Se gli output non sono d'accordo sul fatto che una garanzia copra i danni accidentali, un'alta entropia semantica può attivare il recupero di documenti, chiarimenti o la revisione umana. Combinato con la generazione aumentata da recupero (RAG), questo riduce la probabilità che un'affermazione di policy non supportata raggiunga il cliente.
Supporto alle decisioni visione-linguaggio: Un vision-language model (VLM) potrebbe descrivere un'immagine industriale come indicante "corrosione superficiale", "residuo di olio" o "normale scolorimento" in generazioni ripetute. Un'alta entropia semantica indica un disaccordo significativo che potrebbe portare a una decisione di manutenzione errata. Il sistema può indirizzare l'immagine a un ispettore anziché trattare una singola descrizione fluente come definitiva.
Uso Pratico e Limitazioni#
L'entropia semantica dovrebbe essere trattata come un componente di una pipeline di valutazione basata sul rischio. I team dovrebbero verificare se i punteggi più alti corrispondono effettivamente a più errori nel loro dominio, selezionare le soglie in base alle conseguenze degli errori e mantenere un percorso di astensione o revisione umana. Il NIST AI Risk Management Framework Core sottolinea l'importanza di misurare l'incertezza e di collegare i risultati della valutazione al monitoraggio continuo del rischio. (airc.nist.gov)
È più appropriato per output generati aperti. Le previsioni di computer vision strutturate richiedono metodi di valutazione diversi: la modalità di validazione di Ultralytics misura le prestazioni rispetto a dati etichettati, mentre l'entropia semantica può valutare qualsiasi spiegazione in testo libero aggiunta da un componente multimodale.
I team di produzione dovrebbero anche tracciare le distribuzioni dei punteggi, le categorie di errore, la latenza e i cambiamenti nei dati di input. La guida di Google sul monitoraggio dei sistemi ML di produzione consiglia la registrazione e gli avvisi per la deriva delle previsioni e il degrado della qualità. Il monitoraggio del deployment della piattaforma Ultralytics può supportare il più ampio flusso di lavoro di annotazione, addestramento, deployment e monitoraggio che circonda i modelli di vision. L'entropia semantica può identificare i casi incerti all'interno di quel flusso di lavoro, ma la verifica fattuale e i test rappresentativi rimangono essenziali.






