Agent Evaluation
La valutazione degli agenti verifica se un agente IA raggiunge gli obiettivi in modo sicuro ed efficiente, esaminando l'intero sistema composto da modello, strumenti, memoria e ambiente.
La valutazione degli agenti è il test sistematico della capacità di un agente IA di raggiungere obiettivi in modo sicuro, corretto ed efficiente durante una o più interazioni. A differenza della normale valutazione dei modelli, esamina il sistema completo: il modello sottostante, le istruzioni, la memoria, gli strumenti, la logica di controllo e l'ambiente. Una valutazione utile verifica quindi non solo ciò che un agente IA dice o modifica alla fine, ma anche le azioni che intraprende durante il processo.
Come funziona la valutazione degli agenti#
La valutazione inizia con un'attività, ad esempio risolvere una richiesta di assistenza, ispezionare l'immagine di un prodotto o aggiornare un record del database. L'agente tenta di svolgere l'attività in un ambiente di test controllato, generando una traccia o traiettoria: una registrazione di messaggi, output intermedi, chiamate agli strumenti, argomenti, errori e modifiche di stato.
Un valutatore confronta quindi il tentativo con criteri di successo definiti. I valutatori rientrano in tre tipologie comuni: programmi deterministici, valutatori basati su modelli e revisori umani. I controlli deterministici funzionano bene per risultati verificabili, come stabilire se è stato creato un record. I valutatori basati su modelli possono giudicare qualità come la pertinenza o il tono, ma dovrebbero essere calibrati rispetto ai giudizi umani.
Una suite di valutazione contiene normalmente molte attività rappresentative e può ripetere ogni attività più volte, perché il comportamento degli agenti può variare da un'esecuzione all'altra. Deve essere incluso anche l'harness dell'agente: modificare le descrizioni degli strumenti, le regole della memoria o la logica dei nuovi tentativi può alterare le prestazioni anche se il modello sottostante resta invariato.
Che cosa misura la valutazione degli agenti#
Una suite affidabile combina diverse dimensioni invece di condensare le prestazioni in un unico punteggio:
- Successo dell'attività: l'ambiente ha raggiunto lo stato finale richiesto?
- Qualità dell’uso degli strumenti: l’agente ha selezionato lo strumento corretto, fornito argomenti validi e interpretato accuratamente il risultato? Le metriche di valutazione degli agenti di Google includono misure separate per le risposte finali, l’uso degli strumenti, le traiettorie, le allucinazioni e la sicurezza.
- Qualità della traiettoria: le azioni erano pertinenti, nell'ordine corretto e ragionevolmente efficienti? Una risposta corretta raggiunta attraverso passaggi non sicuri o dispendiosi può comunque rappresentare un fallimento.
- Affidabilità: con quale frequenza l'agente riesce in prove ripetute, richieste parafrasate, casi difficili e malfunzionamenti degli strumenti?
- Sicurezza e conformità alle policy: l'agente rispetta le autorizzazioni, protegge i dati sensibili e richiede l'approvazione prima delle azioni con conseguenze rilevanti? Le indicazioni di OWASP sulle minacce dell'IA agentica aiutano i team a identificare rischi come un'autonomia eccessiva e interazioni non sicure con gli strumenti.
- Prestazioni operative: in produzione contano la latenza, l'uso di token, il numero di chiamate agli strumenti, il tasso di errore e il costo per attività completata.
Un set di dati di riferimento di attività revisionate, risultati attesi e casi limite fornisce un riferimento stabile. Tuttavia, dovrebbe essere integrato con casi avversari e problemi riscontrati in produzione. Il NIST AI Resource Center inquadra test, valutazione, verifica, convalida e misurazione continua nella più ampia gestione dei rischi dell'IA.
Valutazione degli agenti e concetti correlati#
La valutazione degli agenti è più ampia della valutazione dei modelli, che di solito verifica gli output di un modello su un set di dati fisso. Si distingue anche dall'osservabilità: l'osservabilità registra ciò che è accaduto in un sistema attivo, mentre la valutazione applica criteri per determinare se quel comportamento era accettabile.
Analogamente, il red teaming dell'IA cerca attivamente malfunzionamenti sfruttabili, mentre la valutazione ordinaria misura ripetutamente capacità note e regressioni. I flussi di lavoro agentici definiscono come vengono svolte le attività; la valutazione verifica se tali flussi producono risultati affidabili.
I test dei singoli componenti restano utili. Per esempio, se un agente usa la visione tramite chiamata di funzioni e uso degli strumenti, chi sviluppa dovrebbe convalidare separatamente il modello di visione prima di valutare l'intero ciclo decisionale.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Questo flusso di lavoro documentato di convalida di Ultralytics YOLO misura il componente di percezione. Non stabilisce se l'agente abbia scelto l'immagine corretta, interpretato correttamente i rilevamenti o intrapreso un'azione appropriata.
Applicazioni nel mondo reale#
-
Ispezione visiva nella produzione: un agente acquisisce l'immagine di un prodotto, richiama un rilevatore, verifica le regole di qualità e indirizza gli elementi incerti a una revisione umana. La valutazione può verificare la precisione del rilevamento dei difetti, la correttezza degli argomenti degli strumenti, il comportamento di escalation e l'effettivo inserimento dei prodotti rifiutati nella coda di ispezione.
-
Agenti vocali per il servizio clienti: un agente vocale può autenticare un chiamante, recuperare informazioni sull'account ed elaborare una richiesta in più turni di conversazione. I test dovrebbero variare accenti, interruzioni, istruzioni ambigue e indisponibilità degli strumenti, misurando al contempo il completamento delle attività, la qualità della conversazione, le azioni non autorizzate e la latenza. Il flusso di lavoro di Google per la valutazione degli agenti descrive la valutazione delle tracce complete, non solo delle risposte finali.
Creare un processo di valutazione pratico#
Inizia con un piccolo insieme di attività normali, casi limite importanti e malfunzionamenti già osservati. Definisci condizioni di superamento osservabili prima di avviare l'agente, quindi combina controlli deterministici con valutazioni basate su rubriche e revisioni umane periodiche. Esegui nuovamente la suite ogni volta che cambiano prompt, modelli, strumenti o Agent Skills.
Dopo la distribuzione, collega i test offline alla revisione di tracce campionate e al monitoraggio dei modelli. Per gli agenti dotati di capacità visive, Ultralytics Platform supporta l'annotazione dei set di dati, l'addestramento dei modelli, la distribuzione e il monitoraggio dei servizi di percezione richiamati dagli agenti. Una valutazione efficace è continua: i malfunzionamenti in produzione diventano nuovi casi di test e ogni modifica al sistema deve dimostrare di migliorare le prestazioni senza compromettere il comportamento consolidato.










