Agent Evaluation
La evaluación de agentes comprueba si un agente de IA alcanza sus objetivos de forma segura y eficiente, y evalúa el sistema completo: modelo, herramientas, memoria y entorno.
La evaluación de agentes consiste en probar sistemáticamente la capacidad de un agente de IA para cumplir objetivos de forma segura, correcta y eficiente en una o varias interacciones. A diferencia de la evaluación habitual de modelos, examina el sistema completo: el modelo subyacente, las instrucciones, la memoria, las herramientas, la lógica de control y el entorno. Por tanto, una evaluación útil comprueba no solo lo que acaba diciendo o modificando un agente de IA, sino también las acciones que realiza durante el proceso.
Cómo funciona la evaluación de agentes#
La evaluación comienza con una tarea, como resolver una solicitud de asistencia, inspeccionar la imagen de un producto o actualizar un registro de una base de datos. El agente intenta realizar la tarea en un entorno de prueba controlado y genera un rastro o trayectoria: un registro de mensajes, resultados intermedios, llamadas a herramientas, argumentos, errores y cambios de estado.
A continuación, un evaluador compara el intento con criterios de éxito definidos. Los evaluadores son de tres tipos habituales: programas deterministas, evaluadores basados en modelos y revisores humanos. Las comprobaciones deterministas funcionan bien con resultados verificables, como saber si se ha creado un registro. Los evaluadores basados en modelos pueden valorar aspectos como la pertinencia o el tono, pero deben calibrarse con juicios humanos.
Una batería de evaluación suele contener muchas tareas representativas y puede repetir cada tarea varias veces, porque el comportamiento de los agentes puede variar entre ejecuciones. También debe incluirse el entorno de ejecución del agente: cambiar las descripciones de las herramientas, las reglas de memoria o la lógica de reintentos puede alterar el rendimiento aunque el modelo subyacente no cambie.
Qué mide la evaluación de agentes#
Una batería fiable combina varias dimensiones en lugar de reducir el rendimiento a una sola puntuación:
- Éxito de la tarea: ¿Se alcanzó el estado final requerido en el entorno?
- Calidad del uso de herramientas: ¿Ha seleccionado el agente la herramienta correcta, ha proporcionado argumentos válidos y ha interpretado correctamente el resultado? Las métricas de evaluación de agentes de Google incluyen medidas independientes para las respuestas finales, el uso de herramientas, las trayectorias, las alucinaciones y la seguridad.
- Calidad de la trayectoria: ¿Fueron pertinentes las acciones, siguieron el orden correcto y resultaron razonablemente eficientes? Una respuesta correcta obtenida mediante pasos inseguros o innecesarios puede seguir considerándose un fallo.
- Fiabilidad: ¿Con qué frecuencia tiene éxito el agente en pruebas repetidas, solicitudes parafraseadas, casos difíciles y fallos de herramientas?
- Seguridad y cumplimiento de las políticas: ¿Respeta los permisos, protege los datos sensibles y solicita aprobación antes de realizar acciones importantes? Las directrices de OWASP sobre amenazas a la IA agéntica ayudan a los equipos a identificar riesgos como una autonomía excesiva y las interacciones inseguras con herramientas.
- Rendimiento operativo: En producción importan la latencia, el uso de tokens, el número de llamadas a herramientas, la tasa de errores y el coste por tarea completada.
Un conjunto de datos de referencia con tareas revisadas, resultados esperados y casos límite proporciona una referencia estable. Sin embargo, debe complementarse con casos adversarios y fallos derivados de la producción. El Centro de Recursos de IA del NIST integra las pruebas, la evaluación, la verificación, la validación y la medición continua en una gestión más amplia de los riesgos de la IA.
Evaluación de agentes y conceptos relacionados#
La evaluación de agentes es más amplia que la evaluación de modelos, que suele probar los resultados de un modelo con un conjunto de datos fijo. También se diferencia de la observabilidad: la observabilidad registra lo ocurrido en un sistema activo, mientras que la evaluación aplica criterios para determinar si ese comportamiento fue aceptable.
Del mismo modo, el red teaming de IA busca activamente fallos explotables, mientras que la evaluación rutinaria mide repetidamente las capacidades conocidas y las regresiones. Los flujos de trabajo agénticos definen cómo se realizan las tareas; la evaluación comprueba si esos flujos de trabajo producen resultados fiables.
Las pruebas de componentes siguen siendo valiosas. Por ejemplo, si un agente utiliza visión mediante llamadas a funciones y uso de herramientas, los desarrolladores deben validar por separado el modelo de visión antes de evaluar el ciclo completo de toma de decisiones.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Este flujo de trabajo documentado de validación de Ultralytics YOLO mide el componente de percepción. No determina si el agente eligió la imagen correcta, interpretó correctamente las detecciones o tomó una medida adecuada.
Aplicaciones en el mundo real#
-
Inspección visual de la fabricación: Un agente captura una imagen de un producto, invoca un detector, comprueba las reglas de calidad y deriva los elementos dudosos para que los revise una persona. La evaluación puede verificar la precisión de la detección de defectos, los argumentos correctos de las herramientas, el comportamiento de escalado y si los productos rechazados llegan realmente a la cola de inspección.
-
Agentes de voz de atención al cliente: Un agente de voz puede autenticar a quien llama, recuperar información de la cuenta y tramitar una solicitud a lo largo de varios turnos. Las pruebas deben variar los acentos, las interrupciones, las instrucciones ambiguas y los fallos de herramientas, y medir al mismo tiempo la finalización de tareas, la calidad de la conversación, las acciones no autorizadas y la latencia. El flujo de trabajo de Google para la evaluación de agentes describe cómo evaluar rastros completos, no solo las respuestas finales.
Cómo crear un proceso práctico de evaluación#
Empieza con un pequeño conjunto de tareas habituales, casos límite importantes y fallos observados anteriormente. Define condiciones de aprobación observables antes de ejecutar el agente y combina comprobaciones deterministas con evaluaciones basadas en rúbricas y revisiones humanas periódicas. Vuelve a ejecutar la batería cada vez que cambien las instrucciones, los modelos, las herramientas o las Agent Skills.
Tras la implementación, combina las pruebas sin conexión con la revisión de muestras de rastros y la supervisión de modelos. Para los agentes con visión, Ultralytics Platform admite la anotación de conjuntos de datos, el entrenamiento de modelos, la implementación y la supervisión de los servicios de percepción que utilizan los agentes. La evaluación eficaz es continua: los fallos en producción se convierten en nuevos casos de prueba y cada cambio del sistema debe demostrar mejoras sin alterar el comportamiento establecido.










