Agent Evaluation
Bei der Agentenbewertung wird geprüft, ob ein KI-Agent Ziele sicher und effizient erreicht. Bewertet wird das Gesamtsystem aus Modell, Werkzeugen, Speicher und Umgebung.
Die Evaluierung von Agenten ist das systematische Testen der Fähigkeit eines KI-Agenten, Ziele über eine oder mehrere Interaktionen hinweg sicher, korrekt und effizient zu erreichen. Anders als eine gewöhnliche Modellevaluierung untersucht sie das gesamte System: das zugrunde liegende Modell, Anweisungen, Speicher, Werkzeuge, Steuerungslogik und Umgebung. Eine aussagekräftige Evaluierung prüft daher nicht nur, was ein KI-Agent letztlich sagt oder ändert, sondern auch die Schritte, die er auf dem Weg dorthin unternimmt.
So funktioniert die Evaluierung von Agenten#
Eine Evaluierung beginnt mit einer Aufgabe, zum Beispiel der Bearbeitung einer Supportanfrage, der Prüfung eines Produktbildes oder der Aktualisierung eines Datenbankeintrags. Der Agent versucht, die Aufgabe in einer kontrollierten Testumgebung zu erledigen, und erzeugt dabei eine Ablaufspur oder Handlungssequenz: eine Aufzeichnung von Nachrichten, Zwischenausgaben, Werkzeugaufrufen, Argumenten, Fehlern und Zustandsänderungen.
Anschließend vergleicht ein Bewertungsverfahren den Versuch mit festgelegten Erfolgskriterien. Es gibt drei gängige Arten von Bewertungsverfahren: deterministische Programme, modellbasierte Beurteilungen und menschliche Prüfer. Deterministische Prüfungen eignen sich gut für verifizierbare Ergebnisse, etwa dafür, ob ein Datensatz angelegt wurde. Modellbasierte Bewertungen können Eigenschaften wie Relevanz oder Ton beurteilen, sollten jedoch anhand menschlicher Einschätzungen kalibriert werden.
Eine Evaluierungssuite umfasst normalerweise viele repräsentative Aufgaben und wiederholt sie möglicherweise mehrmals, da sich das Verhalten eines Agenten zwischen Durchläufen unterscheiden kann. Auch die umgebende Agenten-Testumgebung muss einbezogen werden: Änderungen an Werkzeugbeschreibungen, Speicherregeln oder Wiederholungslogik können die Leistung beeinflussen, selbst wenn das zugrunde liegende Modell unverändert bleibt.
Was die Evaluierung von Agenten misst#
Eine zuverlässige Testsuite kombiniert mehrere Dimensionen, statt die Leistung in einem einzigen Wert zusammenzufassen:
- Aufgabenerfolg: Hat die Umgebung den erforderlichen Endzustand erreicht?
- Qualität der Werkzeugnutzung: Hat der Agent das richtige Werkzeug ausgewählt, gültige Argumente übergeben und das Ergebnis korrekt interpretiert? Googles Metriken zur Agentenbewertung umfassen separate Messwerte für abschließende Antworten, Werkzeugnutzung, Abläufe, Halluzinationen und Sicherheit.
- Qualität der Handlungssequenz: Waren die Schritte relevant, richtig geordnet und angemessen effizient? Eine korrekte Antwort, die durch unsichere oder unnötige Schritte erreicht wurde, kann dennoch einen Fehlschlag darstellen.
- Zuverlässigkeit: Wie oft ist der Agent bei wiederholten Versuchen, umformulierten Anfragen, schwierigen Fällen und Werkzeugausfällen erfolgreich?
- Sicherheit und Einhaltung von Richtlinien: Respektiert der Agent Berechtigungen, schützt er sensible Daten und fordert er vor folgenreichen Maßnahmen eine Genehmigung an? Die OWASP-Leitlinien zu Bedrohungen durch agentische KI helfen Teams, Risiken wie übermäßige Handlungsvollmacht und unsichere Werkzeuginteraktionen zu erkennen.
- Betriebsleistung: Latenz, Tokenverbrauch, Anzahl der Werkzeugaufrufe, Fehlerrate und Kosten pro erledigter Aufgabe sind im Produktivbetrieb wichtig.
Ein Referenzdatensatz mit geprüften Aufgaben, erwarteten Ergebnissen und Sonderfällen bietet eine stabile Vergleichsgrundlage. Er sollte jedoch durch adversariale Fälle und aus dem Produktivbetrieb abgeleitete Fehler ergänzt werden. Das NIST AI Resource Center ordnet Tests, Evaluierung, Verifizierung, Validierung und laufende Messungen in ein umfassenderes Risikomanagement für KI ein.
Evaluierung von Agenten im Vergleich zu verwandten Konzepten#
Die Evaluierung von Agenten ist umfassender als die Modellevaluierung, bei der die Ausgaben eines Modells üblicherweise anhand eines festen Datensatzes getestet werden. Sie unterscheidet sich auch von der Beobachtbarkeit: Die Beobachtbarkeit zeichnet auf, was in einem laufenden System geschehen ist, während die Evaluierung Kriterien anlegt, um zu bestimmen, ob dieses Verhalten akzeptabel war.
Ebenso sucht Red Teaming für KI gezielt nach ausnutzbaren Schwachstellen, während die regelmäßige Evaluierung bekannte Fähigkeiten und Regressionen wiederholt misst. Agentische Abläufe legen fest, wie Aufgaben ausgeführt werden; die Evaluierung prüft, ob diese Abläufe zuverlässige Ergebnisse liefern.
Komponententests bleiben wertvoll. Nutzt ein Agent beispielsweise Bildverarbeitung über Funktionsaufrufe und Werkzeugnutzung, sollten Entwickler das Bildverarbeitungsmodell getrennt validieren, bevor sie den vollständigen Entscheidungsablauf evaluieren.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Dieser dokumentierte Validierungsablauf für Ultralytics YOLO misst die Wahrnehmungskomponente. Er belegt nicht, ob der Agent das richtige Bild ausgewählt, Erkennungen korrekt interpretiert oder eine angemessene Maßnahme ergriffen hat.
Anwendungen in der Praxis#
-
Visuelle Inspektion in der Fertigung: Ein Agent nimmt ein Produktbild auf, ruft einen Detektor auf, prüft Qualitätsregeln und leitet unsichere Fälle zur menschlichen Prüfung weiter. Bei der Evaluierung lassen sich die Genauigkeit der Fehlererkennung, korrekte Werkzeugargumente, das Eskalationsverhalten und die Frage überprüfen, ob abgelehnte Produkte tatsächlich in die Inspektionswarteschlange gelangen.
-
Sprachagenten im Kundenservice: Ein Sprachagent kann Anrufer authentifizieren, Kontoinformationen abrufen und Anfragen über mehrere Gesprächsrunden hinweg bearbeiten. Tests sollten unterschiedliche Akzente, Unterbrechungen, mehrdeutige Anweisungen und Werkzeugausfälle abdecken und zugleich Aufgabenerledigung, Gesprächsqualität, unbefugte Maßnahmen und Latenz messen. Googles Ablauf zur Evaluierung von Agenten beschreibt die Evaluierung vollständiger Ablaufspuren statt ausschließlich endgültiger Antworten.
Einen praktischen Evaluierungsprozess aufbauen#
Beginne mit einer kleinen Auswahl normaler Aufgaben, wichtiger Sonderfälle und bereits beobachteter Fehler. Lege überprüfbare Erfolgskriterien fest, bevor der Agent ausgeführt wird, und kombiniere deterministische Prüfungen mit bewertungsbogenbasierten Prüfungen und regelmäßiger menschlicher Kontrolle. Führe die Testsuite erneut aus, sobald sich Prompts, Modelle, Werkzeuge oder Agent Skills ändern.
Verbinde nach der Bereitstellung Offline-Tests mit stichprobenartigen Prüfungen von Ablaufspuren und der Modellüberwachung. Für Agenten mit Bildverarbeitung unterstützt die Ultralytics Platform die Datensatzannotation, das Modelltraining, die Bereitstellung und die Überwachung der Wahrnehmungsdienste, die Agenten aufrufen. Eine wirksame Evaluierung ist kontinuierlich: Fehler aus dem Produktivbetrieb werden zu neuen Testfällen, und jede Systemänderung muss Verbesserungen nachweisen, ohne bewährtes Verhalten zu beeinträchtigen.










