Agent Evaluation
에이전트 평가는 AI 에이전트가 목표를 안전하고 효율적으로 달성하는지 테스트하며 모델, 도구, 메모리, 환경으로 구성된 전체 시스템을 평가합니다.
에이전트 평가는 AI 에이전트가 하나 이상의 상호작용에서 목표를 안전하고 정확하며 효율적으로 달성하는 능력을 체계적으로 테스트하는 과정입니다. 일반적인 모델 평가와 달리 기반 모델, 지시, 메모리, 도구, 제어 로직 및 환경을 포함한 전체 시스템을 검토합니다. 따라서 유용한 평가는 AI 에이전트가 최종적으로 무엇을 말하거나 변경하는지뿐만 아니라, 그 과정에서 어떤 조치를 취하는지도 확인합니다.
에이전트 평가의 작동 방식#
평가는 지원 요청 해결, 제품 이미지 검사 또는 데이터베이스 레코드 업데이트와 같은 작업으로 시작합니다. 에이전트는 제어된 테스트 환경에서 작업을 수행하며, 메시지, 중간 출력, 도구 호출, 인수, 오류 및 상태 변화를 기록한 추적(trace) 또는 궤적(trajectory)을 생성합니다.
그레이더는 시도 결과를 정의된 성공 기준과 비교합니다. 그레이더는 세 가지 일반적인 유형으로 나뉩니다. 결정론적 프로그램, 모델 기반 평가자, 사람 검토자입니다. 결정론적 검사는 레코드가 생성되었는지처럼 검증 가능한 결과에 적합합니다. 모델 기반 그레이더는 관련성이나 어조와 같은 품질을 평가할 수 있지만, 사람의 판단을 기준으로 보정해야 합니다.
평가 스위트에는 일반적으로 대표 작업이 다수 포함되며, 에이전트의 동작이 실행마다 달라질 수 있으므로 각 작업을 여러 차례 반복하기도 합니다. 주변의 에이전트 하네스도 평가에 포함해야 합니다. 기반 모델이 바뀌지 않더라도 도구 설명, 메모리 규칙 또는 재시도 로직이 달라지면 성능이 변할 수 있습니다.
에이전트 평가의 측정 항목#
신뢰할 수 있는 평가 스위트는 성능을 단일 점수로 압축하기보다 여러 차원을 조합합니다.
- 작업 성공: 환경이 요구된 최종 상태에 도달했습니까?
- 도구 사용 품질: 에이전트가 올바른 도구를 선택하고 유효한 인수를 제공하며 결과를 정확하게 해석했습니까? Google의 에이전트 평가 지표에는 최종 응답, 도구 사용, 궤적, 환각, 안전성을 각각 측정하는 항목이 포함되어 있습니다.
- 궤적 품질: 조치가 관련성이 있고 순서가 올바르며 효율적이었습니까? 안전하지 않거나 불필요하게 많은 단계를 거쳐 올바른 답에 도달했다면 여전히 실패로 볼 수 있습니다.
- 신뢰성: 반복 실험, 바꿔 쓴 요청, 어려운 사례 및 도구 오류 전반에서 에이전트가 얼마나 자주 성공합니까?
- 안전성 및 정책 준수: 에이전트가 권한을 준수하고, 민감한 데이터를 보호하며, 중대한 조치 전에 승인을 요청합니까? OWASP 에이전틱 AI 위협 지침은 과도한 자율성 및 안전하지 않은 도구 상호작용과 같은 위험을 식별하는 데 도움이 됩니다.
- 운영 성능: 프로덕션에서는 지연 시간, 토큰 사용량, 도구 호출 횟수, 오류율 및 작업당 비용이 중요합니다.
검토된 작업, 기대 결과 및 엣지 케이스로 구성된 골든 데이터셋은 안정적인 기준을 제공합니다. 그러나 적대적 사례와 프로덕션에서 얻은 실패 사례도 함께 포함해야 합니다. NIST AI 리소스 센터는 테스트, 평가, 검증, 확인 및 지속적인 측정을 더 폭넓은 AI 위험 관리의 일부로 다룹니다.
에이전트 평가와 관련 개념의 차이#
에이전트 평가는 보통 고정된 데이터셋에서 모델 출력을 테스트하는 모델 평가보다 범위가 넓습니다. 또한 관측 가능성과도 다릅니다. 관측 가능성은 라이브 시스템에서 발생한 일을 기록하는 반면, 평가는 기준을 적용해 해당 동작이 허용 가능한지 판단합니다.
마찬가지로 AI 레드팀 테스트는 악용 가능한 실패를 적극적으로 찾는 반면, 정기 평가는 알려진 역량과 회귀를 반복적으로 측정합니다. 에이전틱 워크플로는 작업 수행 방식을 정의하고, 평가는 해당 워크플로가 신뢰할 수 있는 결과를 내는지 테스트합니다.
구성 요소 테스트도 여전히 중요합니다. 예를 들어 에이전트가 함수 호출 및 도구 사용을 통해 비전을 활용한다면, 개발자는 전체 의사 결정 루프를 평가하기 전에 비전 모델을 별도로 검증해야 합니다.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")이 문서화된 Ultralytics YOLO 검증 워크플로는 인식 구성 요소를 측정합니다. 하지만 에이전트가 올바른 이미지를 선택했는지, 감지 결과를 정확히 해석했는지 또는 적절한 조치를 취했는지를 입증하지는 않습니다.
실제 적용 사례#
-
제조 시각 검사: 에이전트가 제품 이미지를 캡처하고, 감지기를 호출하며, 품질 규칙을 확인하고, 불확실한 제품을 사람의 검토 대상으로 전달합니다. 평가를 통해 결함 감지 정확도, 올바른 도구 인수, 상위 단계로 전달하는 동작, 불합격 제품이 실제로 검사 대기열에 들어가는지를 검증할 수 있습니다.
-
고객 서비스 음성 에이전트: 음성 에이전트는 여러 차례 대화에 걸쳐 발신자 인증, 계정 정보 조회 및 요청 처리를 수행할 수 있습니다. 작업 완료율, 대화 품질, 무단 조치 및 지연 시간을 측정하면서 억양, 대화 중단, 모호한 지시 및 도구 중단 상황을 바꿔 가며 테스트해야 합니다. Google의 에이전트 평가 워크플로는 최종 응답만이 아니라 전체 추적을 평가하는 방법을 설명합니다.
실용적인 평가 프로세스 구축#
일반적인 작업, 중요한 엣지 케이스 및 이전에 관찰된 실패 사례로 이루어진 작은 집합부터 시작합니다. 에이전트를 실행하기 전에 관찰 가능한 통과 조건을 정의한 다음, 결정론적 검사와 평가 기준표를 활용한 검토 및 정기적인 사람의 검토를 조합합니다. 프롬프트, 모델, 도구 또는 에이전트 스킬이 변경될 때마다 평가 스위트를 다시 실행합니다.
배포 후에는 오프라인 테스트를 샘플링된 추적 검토 및 모델 모니터링에 연결합니다. 비전 기능을 갖춘 에이전트의 경우, Ultralytics Platform은 에이전트가 호출하는 인식 서비스의 데이터셋 어노테이션, 모델 학습, 배포 및 모니터링을 지원합니다. 효과적인 평가는 지속적으로 이루어집니다. 프로덕션 실패를 새 테스트 사례로 추가하고, 기존 동작을 손상시키지 않으면서 개선되었음을 모든 시스템 변경을 통해 입증해야 합니다.










