Agent Evaluation
Aprende como a avaliação de agentes testa agentes de IA quanto ao sucesso em tarefas, uso de ferramentas, segurança, fiabilidade e eficiência em fluxos de trabalho e interações do mundo real.
A avaliação de agentes é o teste sistemático da capacidade de um agente de IA para concluir objetivos com segurança, correção e eficiência ao longo de uma ou mais interações. Ao contrário da avaliação comum de modelos, ela examina o sistema completo: o modelo subjacente, as instruções, a memória, as ferramentas, a lógica de controle e o ambiente. Uma avaliação útil, portanto, verifica não apenas o que um agente de IA diz ou altera no final, mas também as ações que ele executa ao longo do caminho.
Como Funciona a Avaliação de Agentes#
Uma avaliação começa com uma tarefa, como resolver uma solicitação de suporte, inspecionar a imagem de um produto ou atualizar um registro de banco de dados. O agente tenta realizar a tarefa dentro de um ambiente de teste controlado, produzindo um rastreio ou trajetória: um registro de mensagens, saídas intermediárias, chamadas de ferramentas, argumentos, erros e alterações de estado.
Um avaliador compara então a tentativa com critérios de sucesso definidos. Conforme explicado no guia de avaliações para agentes de IA da Anthropic, os avaliadores podem ser programas determinísticos, juízes baseados em modelos ou revisores humanos. As verificações determinísticas funcionam bem para resultados verificáveis, como saber se um registro foi criado. Os avaliadores baseados em modelos podem avaliar qualidades como relevância ou tom, mas devem ser calibrados com base em julgamentos humanos.
Uma suíte de avaliação normalmente contém muitas tarefas representativas e pode repetir cada tarefa várias vezes, pois o comportamento do agente pode variar entre as execuções. A estrutura do agente ao redor também deve ser incluída: alterar as descrições das ferramentas, as regras de memória ou a lógica de repetição pode alterar o desempenho mesmo quando o modelo subjacente permanece inalterado.
O que a Avaliação de Agentes Mede#
Uma suíte confiável combina várias dimensões em vez de comprimir o desempenho em uma única pontuação:
- Sucesso da tarefa: O ambiente atingiu o estado final necessário?
- Qualidade do uso de ferramentas: O agente selecionou a ferramenta correta, forneceu argumentos válidos e interpretou seu resultado com precisão? As métricas de avaliação de agentes do Google incluem medidas separadas para respostas finais, uso de ferramentas, trajetórias, alucinações e segurança.
- Qualidade da trajetória: As ações foram relevantes, ordenadas corretamente e razoavelmente eficientes? Uma resposta correta alcançada por meio de etapas inseguras ou desperdiçadoras ainda pode representar uma falha.
- Confiabilidade: Com que frequência o agente tem sucesso em tentativas repetidas, solicitações refraseadas, casos difíceis e falhas de ferramentas?
- Segurança e conformidade de políticas: Ele respeita permissões, protege dados confidenciais e solicita aprovação antes de ações consequentes? As diretrizes de ameaças de IA agêntica da OWASP ajudam as equipes a identificar riscos como agência excessiva e interações inseguras com ferramentas.
- Desempenho operacional: Latência, uso de tokens, contagem de chamadas de ferramentas, taxa de erros e custo por tarefa concluída importam em produção.
Um conjunto de dados de referência de tarefas revisadas, resultados esperados e casos limítrofes fornece uma base estável. No entanto, ele deve ser complementado com casos adversariais e falhas derivadas de produção. O NIST AI Resource Center posiciona testes, avaliação, verificação, validação e medição contínua dentro de um gerenciamento mais amplo de riscos de IA.
Avaliação de Agentes vs. Conceitos Relacionados#
A avaliação de agentes é mais ampla do que a avaliação de modelos, que geralmente testa as saídas de um modelo em um conjunto de dados fixo. Ela também difere da observabilidade: a observabilidade registra o que aconteceu em um sistema ativo, enquanto a avaliação aplica critérios para determinar se esse comportamento era aceitável.
Da mesma forma, o red teaming de IA busca ativamente por falhas exploráveis, enquanto a avaliação de rotina mede capacidades conhecidas e regressões repetidamente. Os fluxos de trabalho agênticos definem como as tarefas são executadas; a avaliação testa se esses fluxos de trabalho produzem resultados confiáveis.
Os testes de componentes continuam valiosos. Por exemplo, se um agente usa visão por meio de chamada de função e uso de ferramentas, os desenvolvedores devem validar separadamente o modelo de visão antes de avaliar o ciclo completo de tomada de decisão.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Este fluxo de trabalho documentado de validação do Ultralytics YOLO mede o componente de percepção. Ele não estabelece se o agente escolheu a imagem certa, interpretou as detecções corretamente ou tomou uma ação apropriada.
Aplicações no Mundo Real#
-
Inspeção visual de fabricação: Um agente captura a imagem de um produto, aciona um detector, verifica as regras de qualidade e encaminha itens incertos para revisão humana. A avaliação pode verificar a precisão na detecção de defeitos, os argumentos corretos das ferramentas, o comportamento de escalonamento e se os produtos rejeitados realmente entram na fila de inspeção.
-
Agentes de voz de atendimento ao cliente: Um agente de voz pode autenticar quem liga, recuperar informações da conta e processar uma solicitação em vários turnos. Os testes devem variar sotaques, interrupções, instruções ambíguas e quedas de ferramentas, enquanto medem a conclusão da tarefa, a qualidade conversacional, ações não autorizadas e a latência. O fluxo de trabalho de avaliação de agentes do Google descreve a avaliação de rastreios completos em vez de apenas as respostas finais.
Construindo um Processo de Avaliação Prático#
Comece com um pequeno conjunto de tarefas normais, casos limítrofes importantes e falhas observadas anteriormente. Defina condições de aprovação observáveis antes de executar o agente, depois combine verificações determinísticas com revisões baseadas em rubricas e revisões humanas periódicas. Execute novamente a suíte sempre que prompts, modelos, ferramentas ou habilidades de agentes forem alterados.
Após a implantação, conecte os testes offline com a revisão de rastreios amostrados e o monitoramento de modelos. Para agentes habilitados para visão, a Ultralytics Platform oferece suporte à anotação de conjuntos de dados, treinamento de modelos, implantação e monitoramento dos serviços de percepção chamados pelos agentes. A avaliação eficaz é contínua: falhas de produção tornam-se novos casos de teste, e cada alteração no sistema deve demonstrar melhoria sem quebrar o comportamento estabelecido.






