Agent Evaluation
Apprends comment l'évaluation des agents teste les agents d'IA pour la réussite des tâches, l'utilisation des outils, la sécurité, la fiabilité et l'efficacité dans des flux de travail et des interactions du monde réel.
L'évaluation des agents consiste à tester systématiquement la capacité d'un agent IA à atteindre des objectifs de manière sûre, correcte et efficace au cours d'une ou de plusieurs interactions. Contrairement à l'évaluation de modèles ordinaires, elle examine le système complet : le modèle sous-jacent, les instructions, la mémoire, les outils, la logique de contrôle et l'environnement. Une évaluation utile vérifie donc non seulement ce qu'un agent IA dit ou modifie en fin de compte, mais aussi les actions qu'il entreprend en chemin.
Comment fonctionne l'évaluation des agents#
Une évaluation commence par une tâche, telle que la résolution d'une demande de support, l'inspection de l'image d'un produit ou la mise à jour d'un enregistrement de base de données. L'agent tente d'exécuter la tâche dans un environnement de test contrôlé, produisant une trace ou une trajectoire : un enregistrement des messages, des sorties intermédiaires, des appels d'outils, des arguments, des erreurs et des changements d'état.
Un évaluateur compare ensuite la tentative avec des critères de réussite définis. Comme l'explique le guide d'Anthropic sur les évaluations pour les agents IA, les évaluateurs peuvent être des programmes déterministes, des juges basés sur des modèles ou des réviseurs humains. Les vérifications déterministes fonctionnent bien pour des résultats vérifiables, tels que la création ou non d'un enregistrement. Les évaluateurs basés sur des modèles peuvent évaluer des qualités telles que la pertinence ou le ton, mais doivent être étalonnés par rapport aux jugements humains.
Une suite d'évaluation contient normalement de nombreuses tâches représentatives et peut répéter chaque tâche plusieurs fois, car le comportement d'un agent peut varier d'une exécution à l'autre. Le harnais d'agent environnant doit également être inclus : la modification des descriptions d'outils, des règles de mémoire ou de la logique de nouvelle tentative peut altérer les performances même lorsque le modèle sous-jacent reste inchangé.
Ce que mesure l'évaluation des agents#
Une suite fiable combine plusieurs dimensions au lieu de compresser les performances en un seul score :
- Succès de la tâche : L'environnement a-t-il atteint l'état final requis ?
- Qualité de l'utilisation des outils : L'agent a-t-il sélectionné le bon outil, fourni des arguments valides et interprété son résultat avec précision ? Les métriques d'évaluation des agents de Google incluent des mesures distinctes pour les réponses finales, l'utilisation des outils, les trajectoires, les hallucinations et la sécurité.
- Qualité de la trajectoire : Les actions étaient-elles pertinentes, correctement ordonnées et raisonnablement efficaces ? Une réponse correcte obtenue par des étapes non sécurisées ou gaspillées peut toujours représenter un échec.
- Fiabilité : À quelle fréquence l'agent réussit-il à travers des essais répétés, des requêtes paraphrasées, des cas difficiles et des pannes d'outils ?
- Sécurité et conformité aux politiques : Respecte-t-il les autorisations, protège-t-il les données sensibles et demande-t-il une approbation avant des actions lourdes de conséquences ? Le guide sur les menaces de l'IA agentique de l'OWASP aide les équipes à identifier les risques tels qu'une agence excessive et des interactions d'outils non sécurisées.
- Performance opérationnelle : La latence, l'utilisation des jetons, le nombre d'appels d'outils, le taux d'erreur et le coût par tâche achevée comptent en production.
Un ensemble de données doré de tâches examinées, de résultats attendus et de cas limites fournit une référence stable. Cependant, il doit être complété par des cas contradictoires et des échecs dérivés de la production. Le centre de ressources sur l'IA du NIST place les tests, l'évaluation, la vérification, la validation et la mesure continue au sein d'une gestion des risques de l'IA plus large.
Évaluation des agents vs concepts associés#
L'évaluation des agents est plus vaste que l'évaluation des modèles, qui teste généralement les sorties d'un modèle sur un ensemble de données fixe. Elle diffère également de l'observabilité : l'observabilité enregistre ce qui s'est passé dans un système en direct, tandis que l'évaluation applique des critères pour déterminer si ce comportement était acceptable.
De même, le red teaming de l'IA recherche activement des défaillances exploitables, tandis que l'évaluation de routine mesure de manière répétée les capacités connues et les régressions. Les flux de travail agentiques définissent la manière dont les tâches sont exécutées ; l'évaluation teste si ces flux de travail produisent des résultats fiables.
Les tests de composants restent précieux. Par exemple, si un agent utilise la vision par le biais de l'appel de fonctions et de l'utilisation d'outils, les développeurs doivent valider séparément le modèle de vision avant d'évaluer la boucle de prise de décision complète.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Ce flux de travail de validation Ultralytics YOLO documenté mesure le composant de perception. Il n'établit pas si l'agent a choisi la bonne image, interprété correctement les détections ou pris une mesure appropriée.
Applications concrètes#
-
Inspection visuelle de fabrication : Un agent capture l'image d'un produit, invoque un détecteur, vérifie les règles de qualité et achemine les articles incertains pour un examen humain. L'évaluation peut vérifier la précision de la détection des défauts, les arguments corrects des outils, le comportement d'escalade et si les produits rejetés entrent effectivement dans la file d'attente d'inspection.
-
Agents vocaux du service client : Un agent vocal peut authentifier un appelant, récupérer des informations de compte et traiter une demande sur plusieurs tours. Les tests doivent varier les accents, les interruptions, les instructions ambiguës et les pannes d'outils tout en mesurant l'achèvement des tâches, la qualité conversationnelle, les actions non autorisées et la latence. Le flux de travail d'évaluation des agents de Google décrit l'évaluation des traces complètes plutôt que des seules réponses finales.
Construire un processus d'évaluation pratique#
Commencez par un petit ensemble de tâches normales, de cas limites importants et d'échecs précédemment observés. Définissez des conditions de réussite observables avant d'exécuter l'agent, puis combinez des vérifications déterministes avec un examen humain périodique et basé sur des grilles d'évaluation. Réexécutez la suite chaque fois que les invites, les modèles, les outils ou les compétences d'agent changent.
Après le déploiement, connectez les tests hors ligne à l'examen de traces échantillonnées et à la surveillance des modèles. Pour les agents dotés de capacités de vision, la plateforme Ultralytics prend en charge l'annotation de jeux de données, l'entraînement de modèles, le déploiement et la surveillance des services de perception appelés par les agents. Une évaluation efficace est continue : les pannes de production deviennent de nouveaux cas de test, et chaque modification du système doit démontrer une amélioration sans casser le comportement établi.






