Agent Evaluation
実際のワークフローやインタラクションを通じて、AIエージェントのタスク達成度、ツール使用、安全性、信頼性、効率性をテストする方法について学びます。
エージェント評価とは、1回または複数回のインタラクションを通じて、AIエージェントが目標を安全、確実、かつ効率的に達成する能力を体系的にテストすることです。通常のモデル評価とは異なり、基盤となるモデル、指示、メモリ、ツール、制御ロジック、環境というシステム全体を検証します。したがって、有用な評価では、AIエージェントが最終的に発言または変更する内容だけでなく、その過程で行ったアクションも確認します。
エージェント評価の仕組み#
評価は、サポートリクエストの解決、製品画像の検査、データベースレコードの更新などのタスクから始まります。エージェントは制御されたテスト環境内でタスクを実行し、トレースまたは軌跡を生成します。これは、メッセージ、中間出力、ツール呼び出し、引数、エラー、状態変更の記録です。
次に、グレーダー(評価者)がその試行結果と定義済みの成功基準を比較します。AnthropicのAIエージェント向け評価ガイドで説明されているように、グレーダーは、決定論的プログラム、モデルベースのジャッジ、または人間のレビュー担当者のいずれかになります。決定論的なチェックは、レコードが作成されたかどうかなどの検証可能な結果に対して効果的です。モデルベースのグレーダーは関連性やトーンなどの品質を評価できますが、人間の判断に基づいて調整する必要があります。
評価スイートには通常、多くの代表的なタスクが含まれており、エージェントの動作が実行ごとに異なる可能性があるため、各タスクを数回繰り返すことがあります。周囲のエージェントハーネスも含める必要があります。ツール記述、メモリルール、またはリトライロジックを変更すると、基盤となるモデルが同じままであってもパフォーマンスが変わる可能性があるためです。
エージェント評価の測定項目#
信頼性の高いスイートでは、パフォーマンスを1つのスコアに圧縮するのではなく、いくつかの側面を組み合わせます。
- タスクの成功: 環境は必要な最終状態に到達したか?
- ツール使用の品質: エージェントは正しいツールを選択し、有効な引数を提供し、その結果を正確に解釈したか?Googleのエージェント評価指標には、最終応答、ツール使用、軌跡、ハルシネーション、および安全性に関する個別の測定が含まれています。
- 軌跡の品質: アクションは関連性があり、正しい順序であり、妥当な効率であったか?安全でない手順や無駄な手順を経て到達した正解は、依然として失敗を意味する可能性があります。
- 信頼性: エージェントは、繰り返しの試行、言い換えられたリクエスト、困難なケース、およびツールの障害を通じて、どれくらいの頻度で成功するか?
- 安全性とポリシーコンプライアンス: 権限を尊重し、機密データを保護し、重大なアクションの前に承認を求めているか?OWASPエージェント型AI脅威ガイダンスは、過剰なエージェンシーや安全でないツールインタラクションなどのリスクをチームが特定するのに役立ちます。
- 運用パフォーマンス: レイテンシー、トークン使用量、ツール呼び出し回数、エラー率、および完了したタスクあたりのコストは、本番環境で重要になります。
レビュー済みのタスク、予期される結果、およびエッジケースのゴールデンデータセットは、安定した基準を提供します。ただし、これには敵対的ケースや本番環境に由来する障害を補う必要があります。NIST AIリソースセンターは、テスト、評価、検証、妥当性確認、および継続的な測定を、より広範なAIリスク管理の中に位置付けています。
エージェント評価と関連概念の比較#
エージェント評価はモデル評価よりも広範であり、モデル評価は通常、固定データセットでのモデルの出力をテストします。また、オブザーバビリティとも異なります。オブザーバビリティはライブシステムで何が起こったかを記録し、評価は基準を適用してその動作が許容できるかどうかを判断します。
同様に、AIレッドチーミングは悪用可能な障害を積極的に探索しますが、通常の評価は既知の機能と回帰を繰り返し測定します。エージェントワークフローはタスクの実行方法を定義し、評価はそのワークフローが信頼性の高い結果を生成するかどうかをテストします。
コンポーネントテストは依然として価値があります。たとえば、エージェントが関数呼び出しとツール使用を通じてビジョンを使用する場合、開発者は完全な意思決定ループを評価する前に、ビジョンモデルを個別に検証する必要があります。
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")このドキュメント化されたUltralytics YOLO検証ワークフローは、知覚コンポーネントを測定します。エージェントが適切な画像を選択したか、検出結果を正しく解釈したか、適切なアクションを実行したかを確立するものではありません。
実社会での応用#
-
製造業における視覚検査: エージェントが製品画像をキャプチャし、検出器を呼び出し、品質ルールを確認し、不確実なアイテムを人間のレビュー用にルーティングします。評価により、欠陥検出の精度、正しいツールの引数、エスカレーション動作、および拒否された製品が実際に検査キューに入るかどうかが検証されます。
-
カスタマーサービス音声エージェント: 音声エージェントは、発信者の認証、アカウント情報の取得、および複数のターンにわたるリクエストの処理を行う場合があります。テストでは、アクセント、中断、曖昧な指示、およびツールの停止を変化させながら、タスクの完了、会話の品質、不正なアクション、およびレイテンシーを測定する必要があります。Googleのエージェント評価ワークフローでは、最終的な応答単体ではなく、完全なトレースの評価について説明しています。
実践的な評価プロセスの構築#
通常のタスク、重要なエッジケース、および以前に観測された障害の小さなセットから始めます。エージェントを実行する前に観測可能な合格条件を定義し、その後、決定論的チェックとルーブリックベースおよび定期的な人間のレビューを組み合わせます。プロンプト、モデル、ツール、またはエージェントスキルが変更されるたびに、スイートを再実行します。
デプロイ後、オフラインテストをサンプリングされたトレースレビューおよびモデルモニタリングと接続します。ビジョン対応エージェントの場合、Ultralytics Platformは、データセットのアノテーション、モデルのトレーニング、デプロイ、およびエージェントが呼び出す知覚サービスのモニタリングをサポートします。効果的な評価は継続的なものであり、本番環境での障害が新しいテストケースとなり、すべてのシステムの変更は、既存の動作を壊すことなく改善を示す必要があります。






