YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Agent Evaluation

Erfahre, wie die Agentenevaluierung KI-Agenten auf Aufgabenerfolg, Werkzeugnutzung, Sicherheit, Zuverlässigkeit und Effizienz in realen Workflows und Interaktionen testet.

Die Agent-Evaluierung ist das systematische Testen der Fähigkeit eines KI-Agenten, Ziele über eine oder mehrere Interaktionen hinweg sicher, korrekt und effizient zu erreichen. Im Gegensatz zur gewöhnlichen Modell-Evaluierung untersucht sie das gesamte System: das zugrunde liegende Modell, Anweisungen, Speicher, Tools, Steuerungslogik und Umgebung. Eine nützliche Evaluierung prüft daher nicht nur, was ein AI agent letztendlich sagt oder ändert, sondern auch die Schritte, die er auf dem Weg dorthin unternimmt.

Wie die Agent-Evaluierung funktioniert#

Eine Evaluierung beginnt mit einer Aufgabe, wie etwa dem Lösen einer Support-Anfrage, dem Überprüfen eines Produktbildes oder dem Aktualisieren eines Datenbankeintrags. Der Agent versucht die Aufgabe in einer kontrollierten Testumgebung und erzeugt dabei eine trace oder trajectory: eine Aufzeichnung von Nachrichten, Zwischenausgaben, Tool-Aufrufen, Argumenten, Fehlern und Statusänderungen.

Ein Prüfer vergleicht den Versuch anschließend mit definierten Erfolgskriterien. Wie im guide to evaluations for AI agents von Anthropic erläutert, können Prüfer deterministische Programme, modellbasierte Richter oder menschliche Prüfer sein. Deterministische Prüfungen eignen sich gut für verifizierbare Ergebnisse, wie zum Beispiel die Frage, ob ein Datensatz erstellt wurde. Modellbasierte Prüfer können Qualitäten wie Relevanz oder Tonfall bewerten, sollten jedoch anhand menschlicher Urteile kalibriert werden.

Eine Evaluierungssuite enthält normalerweise viele repräsentative Aufgaben und wiederholt jede Aufgabe möglicherweise mehrmals, da das Agentenverhalten zwischen den Durchläufen variieren kann. Die umgebende agent harness muss ebenfalls einbezogen werden: Änderungen an Tool-Beschreibungen, Speicherregeln oder Wiederholungslogik können die Leistung verändern, selbst wenn das zugrunde liegende Modell unverändert bleibt.

Was die Agent-Evaluierung misst#

Eine zuverlässige Suite kombiniert mehrere Dimensionen, anstatt die Leistung in einen einzigen Wert zu komprimieren:

  • Aufgabenerfolg: Hat die Umgebung den erforderlichen Endstatus erreicht?
  • Qualität der Tool-Nutzung: Hat der Agent das richtige Tool ausgewählt, gültige Argumente bereitgestellt und sein Ergebnis korrekt interpretiert? Googles agent evaluation metrics umfassen separate Messwerte für finale Antworten, Tool-Nutzung, Trajektorien, Halluzinationen und Sicherheit.
  • Trajektorienqualität: Waren die Aktionen relevant, korrekt angeordnet und angemessen effizient? Eine richtige Antwort, die durch unsichere oder verschwenderische Schritte erreicht wurde, kann dennoch ein Fehlschlag sein.
  • Zuverlässigkeit: Wie oft hat der Agent bei wiederholten Testläufen, paraphrasierten Anfragen, schwierigen Fällen und Tool-Ausfällen Erfolg?
  • Sicherheit und Richtlinienkonformität: Respektiert er Berechtigungen, schützt er sensible Daten und fordert er vor folgenschweren Aktionen eine Genehmigung an? Der OWASP agentic AI threat guidance hilft Teams dabei, Risiken wie übermäßige Autonomie und unsichere Tool-Interaktionen zu erkennen.
  • Betriebsleistung: Latenz, Token-Nutzung, Anzahl der Tool-Aufrufe, Fehlerrate und Kosten pro erledigter Aufgabe sind in der Produktion von Bedeutung.

Ein golden dataset aus überprüften Aufgaben, erwarteten Ergebnissen und Randfällen bietet eine stabile Referenz. Es sollte jedoch durch adversariale Fälle und aus der Produktion stammende Fehler ergänzt werden. Das NIST AI Resource Center verortet Testen, Evaluieren, Verifizieren, Validieren und kontinuierliches Messen innerhalb eines umfassenderen KI-Risikomanagements.

Agent-Evaluierung vs. verwandte Konzepte#

Die Agent-Evaluierung ist umfassender als die Modell-Evaluierung, bei der normalerweise die Ausgaben eines Modells auf einem festen Datensatz getestet werden. Sie unterscheidet sich auch von der observability: Die Observability zeichnet auf, was in einem Live-System passiert ist, während die Evaluierung Kriterien anwendet, um festzustellen, ob dieses Verhalten akzeptabel war.

Ebenso sucht das AI red teaming aktiv nach ausnutzbaren Schwachstellen, während routinemäßige Evaluierungen bekannte Fähigkeiten und Regressionen wiederholt messen. Agentic workflows definieren, wie Aufgaben ausgeführt werden; Evaluierungen testen, ob diese Workflows verlässliche Ergebnisse liefern.

Komponententests bleiben wertvoll. Wenn ein Agent beispielsweise Vision über function calling and tool use nutzt, sollten Entwickler das Vision-Modell separat validieren, bevor sie die vollständige Entscheidungsfindungsschleife evaluieren.

from ultralytics import YOLO

# Load the agent's visual perception model
model = YOLO("yolo26n.pt")

# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")

# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")

Dieser dokumentierte Ultralytics YOLO validation workflow misst die Wahrnehmungskomponente. Er stellt nicht fest, ob der Agent das richtige Bild ausgewählt, Erkennungen korrekt interpretiert oder eine geeignete Aktion ausgeführt hat.

Praxisanwendungen#

  • Manufacturing visual inspection: Ein Agent erfasst ein Produktbild, ruft einen Detektor auf, prüft Qualitätsregeln und leitet unsichere Artikel zur menschlichen Überprüfung weiter. Die Evaluierung kann die Genauigkeit der Defekterkennung, korrekte Tool-Argumente, das Eskalationsverhalten und die Frage überprüfen, ob abgelehnte Produkte tatsächlich in die Prüfwarteschlange gelangen.

  • Voice-Agenten im Kundenservice: Ein Voice-Agent authentifiziert möglicherweise einen Anrufer, ruft Kontoinformationen ab und verarbeitet eine Anfrage über mehrere Dialogschritte hinweg. Tests sollten Akzente, Unterbrechungen, mehrdeutige Anweisungen und Tool-Ausfälle variieren und dabei den Aufgabenerfolg, die Gesprächsqualität, unbefugte Aktionen und die Latenz messen. Googles agent evaluation workflow beschreibt die Evaluierung vollständiger Traces anstelle von nur finalen Antworten.

Aufbau eines praktischen Evaluierungsprozesses#

Beginnen Sie mit einer kleinen Menge normaler Aufgaben, wichtiger Randfälle und zuvor beobachteter Fehler. Definieren Sie beobachtbare Bestanden-Bedingungen, bevor Sie den Agenten ausführen, und kombinieren Sie dann deterministische Prüfungen mit rubrikbasierten und periodischen menschlichen Überprüfungen. Führen Sie die Suite erneut aus, wann immer sich Prompts, Modelle, Tools oder Agent Skills ändern.

Verbinden Sie nach der Bereitstellung Offline-Tests mit st Stichprobenprüfungen von Traces und model monitoring. Für visionsfähige Agenten unterstützt die Ultralytics Platform die Datensatzannotation, das Modelltraining, die Bereitstellung und die Überwachung der Wahrnehmungsdienste, die Agenten aufrufen. Effektive Evaluierung ist kontinuierlich: Produktionsfehler werden zu neuen Testfällen, und jede Systemänderung muss eine Verbesserung zeigen, ohne etabliertes Verhalten zu beeinträchtigen.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens