Agent Evaluation
Đánh giá agent kiểm tra xem một AI agent có đạt mục tiêu một cách an toàn và hiệu quả hay không, bằng cách đánh giá toàn bộ hệ thống gồm model, công cụ, bộ nhớ và môi trường.
Đánh giá agent là quá trình kiểm thử có hệ thống khả năng hoàn thành mục tiêu một cách an toàn, chính xác và hiệu quả của agent AI qua một hoặc nhiều lượt tương tác. Không giống đánh giá model thông thường, quá trình này xem xét toàn bộ hệ thống: model nền tảng, chỉ dẫn, bộ nhớ, công cụ, logic điều khiển và môi trường. Vì vậy, một quy trình đánh giá hữu ích không chỉ kiểm tra điều mà agent AI cuối cùng nói ra hoặc thay đổi, mà còn xem xét các hành động agent thực hiện trên đường đi.
Cách hoạt động của đánh giá agent#
Quá trình đánh giá bắt đầu bằng một tác vụ, chẳng hạn xử lý yêu cầu hỗ trợ, kiểm tra ảnh sản phẩm hoặc cập nhật bản ghi cơ sở dữ liệu. Agent thực hiện tác vụ trong môi trường kiểm thử có kiểm soát và tạo ra một trace hoặc quỹ đạo: bản ghi các tin nhắn, đầu ra trung gian, lệnh gọi công cụ, đối số, lỗi và thay đổi trạng thái.
Sau đó, bộ đánh giá so sánh kết quả với các tiêu chí thành công đã xác định. Bộ đánh giá có ba loại phổ biến: chương trình tất định, bộ đánh giá dựa trên model và người đánh giá. Kiểm tra tất định phù hợp với các kết quả có thể xác minh, chẳng hạn một bản ghi có được tạo hay không. Bộ đánh giá dựa trên model có thể đánh giá các khía cạnh như mức độ liên quan hoặc giọng điệu, nhưng cần được hiệu chuẩn theo đánh giá của con người.
Một bộ đánh giá thường chứa nhiều tác vụ đại diện và có thể lặp lại mỗi tác vụ nhiều lần vì hành vi của agent có thể thay đổi giữa các lần chạy. Cũng cần đưa harness của agent vào đánh giá: thay đổi mô tả công cụ, quy tắc bộ nhớ hoặc logic thử lại có thể làm thay đổi hiệu suất ngay cả khi model nền tảng không đổi.
Đánh giá agent đo lường những gì#
Một bộ đánh giá đáng tin cậy kết hợp nhiều khía cạnh thay vì gộp hiệu suất thành một điểm số duy nhất:
- Mức độ hoàn thành tác vụ: Môi trường có đạt trạng thái cuối cùng theo yêu cầu không?
- Chất lượng sử dụng công cụ: Agent có chọn đúng công cụ, cung cấp đối số hợp lệ và diễn giải chính xác kết quả không? Các chỉ số đánh giá agent của Google bao gồm các phép đo riêng cho phản hồi cuối cùng, việc sử dụng công cụ, chuỗi hành động, ảo giác và độ an toàn.
- Chất lượng quỹ đạo: Các hành động có liên quan, đúng thứ tự và hiệu quả hợp lý không? Một câu trả lời đúng nhưng đạt được bằng các bước không an toàn hoặc lãng phí vẫn có thể là thất bại.
- Độ tin cậy: Agent thành công thường xuyên đến mức nào qua các lần thử lặp lại, yêu cầu được diễn đạt lại, trường hợp khó và lỗi công cụ?
- An toàn và tuân thủ chính sách: Agent có tôn trọng quyền hạn, bảo vệ dữ liệu nhạy cảm và yêu cầu phê duyệt trước các hành động có hệ quả đáng kể không? Hướng dẫn về mối đe dọa đối với AI tác nhân của OWASP giúp các nhóm xác định những rủi ro như quyền tự chủ quá mức và tương tác công cụ không an toàn.
- Hiệu suất vận hành: Độ trễ, mức sử dụng token, số lần gọi công cụ, tỷ lệ lỗi và chi phí cho mỗi tác vụ hoàn thành đều quan trọng trong production.
Một bộ dữ liệu vàng gồm các tác vụ đã được rà soát, kết quả mong đợi và trường hợp biên cung cấp chuẩn tham chiếu ổn định. Tuy nhiên, bộ dữ liệu này cần được bổ sung bằng các trường hợp đối kháng và lỗi phát sinh từ production. Trung tâm Tài nguyên AI của NIST đặt hoạt động kiểm thử, đánh giá, xác minh, xác thực và đo lường liên tục trong khuôn khổ quản lý rủi ro AI rộng hơn.
Đánh giá agent và các khái niệm liên quan#
Đánh giá agent có phạm vi rộng hơn đánh giá model, vốn thường kiểm thử đầu ra của model trên một bộ dữ liệu cố định. Đánh giá agent cũng khác với khả năng quan sát: khả năng quan sát ghi lại những gì đã xảy ra trong hệ thống đang hoạt động, còn đánh giá áp dụng các tiêu chí để xác định hành vi đó có chấp nhận được hay không.
Tương tự, red teaming AI chủ động tìm kiếm các lỗi có thể bị khai thác, trong khi đánh giá định kỳ liên tục đo lường các năng lực đã biết và sự hồi quy. Quy trình làm việc tác nhân xác định cách thực hiện tác vụ; đánh giá kiểm tra xem các quy trình đó có tạo ra kết quả đáng tin cậy hay không.
Kiểm thử thành phần vẫn có giá trị. Ví dụ, nếu agent sử dụng thị giác thông qua gọi hàm và sử dụng công cụ, nhà phát triển nên xác thực riêng model thị giác trước khi đánh giá toàn bộ vòng lặp ra quyết định.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Quy trình xác thực Ultralytics YOLO đã được tài liệu hóa này đo lường thành phần nhận thức. Quy trình không xác định được liệu agent đã chọn đúng ảnh, diễn giải chính xác kết quả phát hiện hay thực hiện hành động phù hợp hay chưa.
Ứng dụng thực tế#
-
Kiểm tra trực quan trong sản xuất: Agent chụp ảnh sản phẩm, gọi bộ phát hiện, kiểm tra các quy tắc chất lượng và chuyển những sản phẩm chưa chắc chắn cho con người xem xét. Đánh giá có thể xác minh độ chính xác phát hiện lỗi, đối số công cụ chính xác, hành vi chuyển cấp và việc sản phẩm bị từ chối có thực sự được đưa vào hàng đợi kiểm tra hay không.
-
Agent thoại dịch vụ khách hàng: Agent thoại có thể xác thực người gọi, truy xuất thông tin tài khoản và xử lý yêu cầu qua nhiều lượt hội thoại. Kiểm thử nên thay đổi giọng vùng miền, tình huống ngắt lời, chỉ dẫn không rõ ràng và sự cố công cụ, đồng thời đo lường mức độ hoàn thành tác vụ, chất lượng hội thoại, hành động trái phép và độ trễ. Quy trình đánh giá agent của Google mô tả việc đánh giá toàn bộ trace thay vì chỉ đánh giá phản hồi cuối cùng.
Xây dựng quy trình đánh giá thực tiễn#
Bắt đầu với một nhóm nhỏ gồm các tác vụ thông thường, trường hợp biên quan trọng và lỗi đã quan sát trước đó. Xác định các điều kiện đạt có thể quan sát được trước khi chạy agent, sau đó kết hợp bước kiểm tra xác định với đánh giá dựa trên rubric và rà soát định kỳ của con người. Chạy lại bộ kiểm thử mỗi khi có thay đổi về prompt, model, công cụ hoặc Agent Skills.
Sau khi triển khai, kết nối kiểm thử ngoại tuyến với việc rà soát trace theo mẫu và giám sát model. Đối với agent có khả năng xử lý hình ảnh, Ultralytics Platform hỗ trợ gán nhãn bộ dữ liệu, huấn luyện model, triển khai và giám sát các dịch vụ nhận thức mà agent gọi đến. Đánh giá hiệu quả là quá trình liên tục: lỗi trong production trở thành trường hợp kiểm thử mới, và mọi thay đổi hệ thống phải chứng minh được sự cải thiện mà không làm hỏng hành vi đã được xác lập.










