YOLO Vision 2026:
Volver al glosario de Ultralytics

Agent Evaluation

Aprende cómo la evaluación de agentes prueba los agentes de IA en cuanto a éxito en tareas, uso de herramientas, seguridad, fiabilidad y eficiencia en flujos de trabajo e interacciones del mundo real.

La evaluación de agentes es la prueba sistemática de la capacidad de un agente de IA para completar objetivos de forma segura, correcta y eficiente a través de una o más interacciones. A diferencia de la evaluación de modelos ordinaria, examina el sistema completo: el modelo subyacente, las instrucciones, la memoria, las herramientas, la lógica de control y el entorno. Por lo tanto, una evaluación útil comprueba no solo lo que un agente de IA dice o cambia en última instancia, sino también las acciones que realiza en el camino.

Cómo funciona la evaluación de agentes#

Una evaluación comienza con una tarea, como resolver una solicitud de soporte, inspeccionar la imagen de un producto o actualizar un registro de base de datos. El agente intenta realizar la tarea dentro de un entorno de prueba controlado, produciendo un registro (trace) o trayectoria: un historial de mensajes, salidas intermedias, llamadas a herramientas, argumentos, errores y cambios de estado.

Un evaluador compara entonces el intento con criterios de éxito definidos. Como se explica en la guía de evaluaciones para agentes de IA de Anthropic, los evaluadores pueden ser programas deterministas, jueces basados en modelos o revisores humanos. Las comprobaciones deterministas funcionan bien para resultados verificables, como si se creó o no un registro. Los evaluadores basados en modelos pueden valorar cualidades como la relevancia o el tono, pero deben calibrarse en función de los juicios humanos.

Una suite de evaluación normalmente contiene muchas tareas representativas y puede repetir cada tarea varias veces porque el comportamiento del agente puede variar entre ejecuciones. También se debe incluir el entorno de ejecución (harness) del agente circundante: cambiar las descripciones de las herramientas, las reglas de memoria o la lógica de reintento puede alterar el rendimiento incluso cuando el modelo subyacente permanece sin cambios.

Qué mide la evaluación de agentes#

Una suite fiable combina varias dimensiones en lugar de comprimir el rendimiento en una única puntuación:

  • Éxito de la tarea: ¿Alcanzó el entorno el estado final requerido?
  • Calidad en el uso de herramientas: ¿Seleccionó el agente la herramienta correcta, proporcionó argumentos válidos e interpretó su resultado con precisión? Las métricas de evaluación de agentes de Google incluyen medidas separadas para respuestas finales, uso de herramientas, trayectorias, alucinaciones y seguridad.
  • Calidad de la trayectoria: ¿Fueron las acciones relevantes, ordenadas correctamente y razonablemente eficientes? Una respuesta correcta alcanzada mediante pasos inseguros o ineficientes puede seguir representando un fallo.
  • Fiabilidad: ¿Con qué frecuencia tiene éxito el agente en ensayos repetidos, solicitudes parafraseadas, casos difíciles y fallos de herramientas?
  • Seguridad y cumplimiento de políticas: ¿Respeta los permisos, protege los datos sensibles y solicita aprobación antes de realizar acciones trascendentales? La guía de amenazas de IA agéntica de OWASP ayuda a los equipos a identificar riesgos como la agencia excesiva y las interacciones inseguras con herramientas.
  • Rendimiento operativo: La latencia, el uso de tokens, el recuento de llamadas a herramientas, la tasa de errores y el coste por tarea completada importan en producción.

Un conjunto de datos dorado (golden dataset) de tareas revisadas, resultados esperados y casos límite proporciona una referencia estable. Sin embargo, debe complementarse con casos de confrontación y fallos derivados de la producción. El Centro de Recursos de IA del NIST sitúa las pruebas, la evaluación, la verificación, la validación y la medición continua dentro de una gestión de riesgos de IA más amplia.

Evaluación de agentes frente a conceptos relacionados#

La evaluación de agentes es más amplia que la evaluación de modelos, que normalmente prueba las salidas de un modelo en un conjunto de datos fijo. También difiere de la observabilidad: la observabilidad registra lo que ocurrió en un sistema en vivo, mientras que la evaluación aplica criterios para determinar si ese comportamiento fue aceptable.

De igual modo, el equipo rojo de IA (AI red teaming) busca activamente fallos explotables, mientras que la evaluación rutinaria mide capacidades conocidas y regresiones de forma repetida. Los flujos de trabajo agénticos definen cómo se realizan las tareas; la evaluación comprueba si dichos flujos de trabajo producen resultados fiables.

Las pruebas de componentes siguen siendo valiosas. Por ejemplo, si un agente utiliza la visión mediante llamadas a funciones y uso de herramientas, los desarrolladores deben validar por separado el modelo de visión antes de evaluar el bucle completo de toma de decisiones.

from ultralytics import YOLO

# Load the agent's visual perception model
model = YOLO("yolo26n.pt")

# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")

# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")

Este flujo de trabajo de validación de Ultralytics YOLO documentado mide el componente de percepción. No establece si el agente eligió la imagen correcta, interpretó las detecciones adecuadamente o tomó una acción apropiada.

Aplicaciones en el mundo real#

  • Inspección visual de fabricación: Un agente captura la imagen de un producto, invoca un detector, comprueba las reglas de calidad y deriva los elementos inciertos para su revisión humana. La evaluación puede verificar la precisión en la detección de defectos, la corrección en los argumentos de las herramientas, el comportamiento de escalado y si los productos rechazados entran realmente en la cola de inspección.

  • Agentes de voz de atención al cliente: Un agente de voz puede autenticar a quien llama, recuperar información de la cuenta y procesar una solicitud a lo largo de varios turnos. Las pruebas deben variar los acentos, las interrupciones, las instrucciones ambiguas y las caídas de herramientas mientras miden la finalización de tareas, la calidad conversacional, las acciones no autorizadas y la latencia. El flujo de trabajo de evaluación de agentes de Google describe la evaluación de rastros completos en lugar de centrarse únicamente en las respuestas finales.

Construcción de un proceso de evaluación práctico#

Empieza con un conjunto reducido de tareas normales, casos límite importantes y fallos observados previamente. Define condiciones de aprobación observables antes de ejecutar el agente, y luego combina comprobaciones deterministas con revisiones humanas periódicas y basadas en rúbricas. Vuelve a ejecutar la suite siempre que cambien los mensajes (prompts), los modelos, las herramientas o las Habilidades de Agente (Agent Skills).

Tras el despliegue, conecta las pruebas fuera de línea con la revisión de rastros muestreados y la monitorización de modelos. Para los agentes con capacidad visual, la Ultralytics Platform admite la anotación de conjuntos de datos, el entrenamiento de modelos, el despliegue y la monitorización de los servicios de percepción a los que llaman los agentes. La evaluación eficaz es continua: los fallos en producción se convierten en nuevos casos de prueba, y cada cambio en el sistema debe demostrar una mejora sin romper el comportamiento establecido.

Explore solutions

Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático