Agent Evaluation
A avaliação de agentes testa se um agente de IA alcança objetivos com segurança e eficiência, avaliando o sistema completo: modelo, ferramentas, memória e ambiente.
A avaliação de agentes é o teste sistemático da capacidade de um agente de IA para cumprir objetivos de forma segura, correta e eficiente ao longo de uma ou mais interações. Ao contrário da avaliação normal de modelos, examina o sistema completo: o modelo subjacente, as instruções, a memória, as ferramentas, a lógica de controlo e o ambiente. Por isso, uma avaliação útil verifica não só o que um agente de IA acaba por dizer ou alterar, mas também as ações que realiza ao longo do processo.
Como funciona a avaliação de agentes#
Uma avaliação começa com uma tarefa, como resolver um pedido de assistência, inspecionar a imagem de um produto ou atualizar um registo numa base de dados. O agente tenta realizar a tarefa num ambiente de teste controlado, produzindo um rasto ou uma trajetória: um registo de mensagens, resultados intermédios, chamadas a ferramentas, argumentos, erros e alterações de estado.
Em seguida, um avaliador compara a tentativa com critérios de sucesso definidos. Os avaliadores dividem-se em três tipos comuns: programas determinísticos, avaliadores baseados em modelos e revisores humanos. As verificações determinísticas funcionam bem para resultados verificáveis, como confirmar se um registro foi criado. Os avaliadores baseados em modelos podem avaliar qualidades como relevância ou tom, mas devem ser calibrados em relação a julgamentos humanos.
Uma suite de avaliação contém normalmente muitas tarefas representativas e pode repetir cada tarefa várias vezes, porque o comportamento do agente pode variar entre execuções. Também é necessário incluir o ambiente de execução do agente: alterar as descrições das ferramentas, as regras da memória ou a lógica de repetição pode modificar o desempenho, mesmo que o modelo subjacente permaneça inalterado.
O que mede a avaliação de agentes#
Uma suite fiável combina várias dimensões em vez de condensar o desempenho numa única pontuação:
- Sucesso na tarefa: O ambiente atingiu o estado final exigido?
- Qualidade da utilização de ferramentas: O agente selecionou a ferramenta correta, forneceu argumentos válidos e interpretou corretamente o resultado? As métricas de avaliação de agentes do Google incluem medidas separadas para respostas finais, utilização de ferramentas, trajetórias, alucinações e segurança.
- Qualidade da trajetória: As ações foram pertinentes, corretamente ordenadas e razoavelmente eficientes? Uma resposta correta alcançada através de etapas inseguras ou desnecessariamente dispendiosas pode continuar a representar uma falha.
- Fiabilidade: Com que frequência o agente é bem-sucedido em ensaios repetidos, pedidos parafraseados, casos difíceis e falhas das ferramentas?
- Segurança e conformidade com as políticas: O agente respeita as permissões, protege os dados sensíveis e pede aprovação antes de realizar ações com consequências importantes? As orientações da OWASP sobre ameaças à IA agêntica ajudam as equipas a identificar riscos como autonomia excessiva e interações inseguras com ferramentas.
- Desempenho operacional: A latência, a utilização de tokens, o número de chamadas a ferramentas, a taxa de erros e o custo por tarefa concluída são importantes em produção.
Um conjunto de dados de referência com tarefas revistas, resultados esperados e casos limite fornece uma referência estável. No entanto, deve ser complementado com casos adversariais e falhas identificadas em produção. O Centro de Recursos de IA do NIST integra testes, avaliação, verificação, validação e medição contínua numa gestão mais abrangente dos riscos de IA.
Avaliação de agentes e conceitos relacionados#
A avaliação de agentes é mais abrangente do que a avaliação de modelos, que normalmente testa os resultados de um modelo num conjunto de dados fixo. Também difere da observabilidade: a observabilidade regista o que aconteceu num sistema ativo, enquanto a avaliação aplica critérios para determinar se esse comportamento foi aceitável.
De forma semelhante, o red teaming de IA procura ativamente falhas exploráveis, enquanto a avaliação de rotina mede repetidamente capacidades conhecidas e regressões. Os fluxos de trabalho agênticos definem como as tarefas são executadas; a avaliação testa se esses fluxos produzem resultados fiáveis.
Os testes dos componentes continuam a ser valiosos. Por exemplo, se um agente utiliza visão através de chamadas a funções e utilização de ferramentas, os programadores devem validar separadamente o modelo de visão antes de avaliar o ciclo completo de tomada de decisões.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Este fluxo de trabalho documentado de validação do Ultralytics YOLO mede o componente de perceção. Não determina se o agente escolheu a imagem certa, interpretou corretamente as deteções ou tomou a ação apropriada.
Aplicações no mundo real#
-
Inspeção visual na indústria transformadora: Um agente capta uma imagem do produto, chama um detetor, verifica as regras de qualidade e encaminha os artigos incertos para revisão humana. A avaliação pode verificar a precisão da deteção de defeitos, os argumentos corretos das ferramentas, o comportamento de escalonamento e se os produtos rejeitados entram efetivamente na fila de inspeção.
-
Agentes de voz para atendimento ao cliente: Um agente de voz pode autenticar uma pessoa que telefona, obter informações da conta e processar um pedido ao longo de várias interações. Os testes devem variar os sotaques, as interrupções, as instruções ambíguas e as indisponibilidades das ferramentas, medindo a conclusão das tarefas, a qualidade da conversa, as ações não autorizadas e a latência. O fluxo de trabalho de avaliação de agentes da Google descreve a avaliação de rastos completos, e não apenas das respostas finais.
Como criar um processo de avaliação prático#
Começa com um pequeno conjunto de tarefas normais, casos limite importantes e falhas observadas anteriormente. Define condições de aprovação observáveis antes de executar o agente e, em seguida, combina verificações determinísticas com avaliações baseadas em critérios e revisões humanas periódicas. Volta a executar a suite sempre que houver alterações aos prompts, modelos, ferramentas ou competências dos agentes.
Após a implementação, associa os testes offline à revisão de amostras de rastos e à monitorização de modelos. Para agentes com capacidade de visão, a Ultralytics Platform permite anotar conjuntos de dados, treinar modelos, implementar e monitorizar os serviços de perceção chamados pelos agentes. Uma avaliação eficaz é contínua: as falhas em produção tornam-se novos casos de teste e cada alteração ao sistema tem de demonstrar uma melhoria sem comprometer o comportamento estabelecido.










