YOLO Vision 2026:
返回 Ultralytics 词汇表

Agent Evaluation

了解智能体评估如何针对真实世界的工作流程和交互中的任务成功率、工具使用、安全性、可靠性以及效率来测试 AI 智能体。

智能体评估是对 AI 智能体在一次或多次交互中安全、正确、高效完成目标的能力进行的系统性测试。与普通模型评估不同,它会检查整个系统:底层模型、指令、记忆、工具、控制 logic 以及环境。因此,一个有用的评估不仅会检查 AI agent 最终说了什么或修改了什么,还会检查它在整个过程中采取的行动。

智能体评估的工作原理#

评估从一个任务开始,例如解决支持请求、检查产品图像或更新数据库记录。智能体在受控的测试环境中尝试该任务,并生成一个 tracetrajectory:即消息、中间输出、工具调用、参数、错误和状态变化的记录。

然后,评分器将尝试与定义的成功标准进行比较。正如 Anthropic 的面向 AI 智能体的评估指南中所解释的那样,评分器可以是确定性程序、基于模型的裁判或人工评审员。确定性检查适用于可验证的结果,例如是否创建了记录。基于模型的评分器可以评估相关性或语调等品质,但应根据人工判断进行校准。

评估套件通常包含许多具有代表性的任务,并且可能会多次重复每个任务,因为智能体行为在多次运行之间可能会有所不同。周围的 agent harness 也必须包括在内:更改工具描述、记忆规则或重试逻辑即使在底层模型保持不变的情况下也可能会改变性能。

智能体评估衡量的内容#

一个可靠的套件结合了几个维度,而不是将性能压缩为一个分数:

  • 任务成功率: 环境是否达到了所需的最终状态?
  • 工具使用质量: 智能体是否选择了正确的工具、提供了有效的参数并准确地解释了其结果?Google 的智能体评估指标包括针对最终响应、工具使用、轨迹、幻觉和安全性的单独度量。
  • 轨迹质量: 行动是否相关、顺序是否正确且相当高效?通过不安全或浪费的步骤达到的正确答案可能仍然代表失败。
  • 可靠性: 智能体在重复试验、释义请求、困难案例和工具故障中成功的频率如何?
  • 安全性和策略合规性: 它是否尊重权限、保护敏感数据并在采取重大行动之前请求批准?OWASP 智能体 AI 威胁指南帮助团队识别诸如过度代理和不安全工具交互等风险。
  • 运营性能: 延迟、令牌使用、工具调用次数、错误率以及每个已完成任务的成本在生产中都很重要。

包含已审查任务、预期结果和边界情况的黄金数据集提供了一个稳定的参考。但是,它应该辅以对抗性案例和生产衍生的故障。NIST AI 资源中心将测试、评估、验证、确认和持续测量置于更广泛的 AI 风险管理之中。

智能体评估与相关概念#

智能体评估比模型评估更广泛,后者通常测试模型在固定数据集上的输出。它也不同于可观测性:可观测性记录实时系统中发生的事情,而评估应用标准来确定该行为是否可接受。

同样,AI 红队测试积极寻找可利用的故障,而常规评估则反复测量已知功能和回归。Agentic workflows 定义了任务的执行方式;评估则测试这些工作流是否产生可靠的结果。

组件测试仍然很有价值。例如,如果智能体通过函数调用和工具使用使用视觉,开发人员应在评估完整的决策循环之前单独验证视觉模型。

from ultralytics import YOLO

# Load the agent's visual perception model
model = YOLO("yolo26n.pt")

# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")

# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")

这个有文档记录的 Ultralytics YOLO validation workflow 测量了感知组件。它并没有确定智能体是否选择了正确的图像、正确解释了检测结果或采取了适当的行动。

实际应用#

  • Manufacturing visual inspection 智能体捕获产品图像、调用检测器、检查质量规则并将不确定的项目路由以供人工审查。评估可以验证缺陷检测准确性、正确的工具参数、升级行为以及被拒绝的产品是否真的进入了检查队列。

  • 客户服务语音智能体: 语音智能体可能会在多个轮次中对来电者进行身份验证、检索帐户信息并处理请求。测试应改变口音、中断、模棱两可的指令和工具中断,同时测量任务完成度、对话质量、未授权操作和延迟。Google 的agent evaluation workflow 描述了评估完整的轨迹,而不仅仅是最终响应。

构建实用的评估流程#

从一小部分正常任务、重要的边界情况以及先前观察到的故障开始。在运行智能体之前定义可观察的通过条件,然后将确定性检查与基于规则和定期的人工审查结合起来。每当提示、模型、工具或 Agent Skills 发生更改时,重新运行套件。

部署后,将离线测试与抽样轨迹审查和模型监控连接起来。对于支持视觉的智能体,Ultralytics Platform 支持数据集注释、模型训练、部署以及智能体调用的感知服务的监控。有效的评估是持续的:生产故障成为新的测试用例,并且每一次系统更改都必须在不破坏既定行为的情况下证明改进。

Explore solutions

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅