Agent Evaluation
エージェント評価では、AIエージェントが目標を安全かつ効率的に達成できるかをテストし、モデル、ツール、メモリ、環境から成るシステム全体を評価します。
エージェント評価とは、1回以上のやり取りを通じて、AIエージェントが目標を安全、正確、効率的に達成できるかを体系的にテストすることです。通常のモデル評価とは異なり、基盤モデル、指示、メモリ、ツール、制御ロジック、環境を含むシステム全体を調べます。そのため、AIエージェントが最終的に何を発言または変更したかだけでなく、その過程でどのような行動を取ったかも評価します。
エージェント評価の仕組み#
評価は、サポート依頼の解決、製品画像の検査、データベースレコードの更新などのタスクから始まります。エージェントは管理されたテスト環境でタスクを実行し、トレースまたは軌跡を生成します。これは、メッセージ、中間出力、ツール呼び出し、引数、エラー、状態の変化を記録したものです。
次に、採点器が試行結果を定義済みの成功基準と比較します。採点器には一般的な3つのタイプがあります。決定論的なプログラム、モデルベースの判定器、人間のレビュアーです。レコードが作成されたかどうかなど、検証可能な結果には決定論的なチェックが適しています。モデルベースの採点器は関連性やトーンなどの特性を評価できますが、人間の判断に照らして調整する必要があります。
評価スイートには通常、多数の代表的なタスクが含まれます。また、エージェントの動作は実行ごとに変わる可能性があるため、各タスクを複数回繰り返す場合があります。周辺のエージェントハーネスも評価対象に含める必要があります。基盤モデルに変更がなくても、ツールの説明、メモリのルール、再試行ロジックを変更すると性能が変わる可能性があります。
エージェント評価で測定する項目#
信頼できる評価スイートでは、性能を1つのスコアに集約するのではなく、複数の指標を組み合わせます。
- タスクの成功: 環境は要求された最終状態に到達しましたか?
- ツール使用の品質: エージェントは適切なツールを選び、有効な引数を渡し、結果を正確に解釈しましたか?Googleのエージェント評価メトリクスには、最終応答、ツール使用、軌跡、ハルシネーション、安全性を個別に測定する指標が含まれています。
- 軌跡の品質: 行動は関連性があり、適切な順序で、効率的でしたか?危険または無駄の多い手順を経て正解にたどり着いた場合も、失敗と見なされることがあります。
- 信頼性: 反復試行、言い換えられた依頼、難しいケース、ツール障害に対して、エージェントはどの程度の頻度で成功しますか?
- 安全性とポリシー遵守: エージェントは権限を守り、機密データを保護し、重大な影響を伴う操作の前に承認を求めますか?OWASPのエージェント型AI脅威ガイダンスは、過剰なエージェンシーや安全でないツール連携などのリスクをチームが特定するのに役立ちます。
- 運用性能: 本番環境では、レイテンシ、トークン使用量、ツール呼び出し回数、エラー率、タスク完了あたりのコストが重要です。
レビュー済みタスク、期待される結果、エッジケースをまとめたゴールデンデータセットは、安定した参照基準になります。ただし、敵対的なケースや本番環境で発生した障害も補足する必要があります。NIST AI Resource Centerでは、テスト、評価、検証、妥当性確認、継続的な測定を、より広範なAIリスクマネジメントの一部として位置付けています。
エージェント評価と関連概念#
エージェント評価は、通常、固定データセットに対するモデルの出力をテストするモデル評価よりも広範です。また、オブザーバビリティとも異なります。オブザーバビリティは稼働中のシステムで何が起きたかを記録しますが、評価では基準を適用し、その挙動が許容可能だったかを判定します。
同様に、AIレッドチーミングは悪用可能な障害を積極的に探すのに対し、通常の評価では既知の能力と劣化を繰り返し測定します。エージェント型ワークフローはタスクの実行方法を定義し、評価はそれらのワークフローが信頼できる結果を生むかをテストします。
コンポーネントテストも引き続き有用です。たとえば、エージェントが関数呼び出しとツール使用を通じてビジョン機能を使う場合、開発者は意思決定ループ全体を評価する前に、ビジョンモデルを個別に検証する必要があります。
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")この文書化されたUltralytics YOLOの検証ワークフローでは、認識コンポーネントを測定します。エージェントが適切な画像を選択したか、検出結果を正しく解釈したか、適切なアクションを取ったかは検証できません。
実際のアプリケーション#
-
製造業の外観検査: エージェントが製品画像を撮影し、検出器を呼び出し、品質ルールを確認して、不確実な製品を人による確認に回します。評価では、欠陥検出の精度、ツール引数の正確さ、エスカレーションの動作、不合格製品が実際に検査キューに入るかを検証できます。
-
カスタマーサービス向け音声エージェント: 音声エージェントは、複数ターンにわたって発信者を認証し、アカウント情報を取得し、依頼を処理する場合があります。テストでは、アクセント、割り込み、曖昧な指示、ツールの停止状況を変化させながら、タスク完了、会話の品質、権限のない操作、レイテンシを測定する必要があります。Googleのエージェント評価ワークフローでは、最終応答だけでなく、完全なトレースを評価する方法を説明しています。
実践的な評価プロセスの構築#
通常のタスク、重要なエッジケース、過去に確認された障害を含む小規模なセットから始めます。エージェントを実行する前に、観測可能な合格条件を定義し、決定論的なチェックと、ルーブリックに基づく定期的な人のレビューを組み合わせます。プロンプト、モデル、ツール、Agent Skillsを変更するたびに、評価スイートを再実行します。
デプロイ後は、オフラインテストをサンプル抽出したトレースのレビューとモデルモニタリングに接続します。ビジョン機能を備えたエージェントでは、エージェントが呼び出す認識サービスのデータセットアノテーション、モデルのトレーニング、デプロイ、モニタリングをUltralytics Platformで支援できます。効果的な評価は継続的なものです。本番環境の障害を新たなテストケースとし、システムを変更するたびに、既存の挙動を損なわずに改善したことを実証する必要があります。










