KI-Leistung messen, um die Auswirkungen deiner Innovationen zu bewerten
Mit den richtigen KPIs und Leistungskennzahlen kannst du den Erfolg deiner KI-Innovationen überwachen. Erfahre, wie du die Auswirkungen von KI-Anwendungen nachverfolgst und optimierst.

Wir haben bereits untersucht, wie AI in verschiedenen Branchen wie dem Gesundheitswesen, der Fertigung und dem Tourismus eingesetzt werden kann. Außerdem haben wir uns angesehen, wie AI alltägliche Arbeitsaufgaben verbessern kann, und führende AI-Geschäftsideen besprochen. All diese Diskussionen führen unweigerlich zu derselben zentralen Frage: Wie können wir den Erfolg solcher AI-Implementierungen messen? Diese Frage ist wichtig, denn AI-Lösungen bereitzustellen, reicht allein nicht aus. Erst wenn sichergestellt ist, dass diese Lösungen tatsächlich Ergebnisse liefern, entfalten sie ihre transformative Wirkung.
Wir können AI-Leistungskennzahlen messen, um festzustellen, ob ein AI-Modell Prozesse tatsächlich effizienter macht, Innovationen anstößt oder Probleme löst. Indem wir uns auf die richtigen wichtigen Leistungsindikatoren (KPIs) konzentrieren, können wir verstehen, wie gut eine AI-Lösung funktioniert und wo Verbesserungsbedarf bestehen könnte.
In diesem Artikel sehen wir uns an, wie sich der Erfolg von AI-Implementierungen anhand der relevantesten KPIs messen lässt. Wir erläutern die Unterschiede zwischen Geschäfts-KPIs und AI-Leistungs-KPIs, gehen auf wichtige Kennzahlen wie Präzision und Recall ein und helfen dir dabei, die besten KPIs für deine spezifischen AI-Lösungen auszuwählen.
Der Unterschied zwischen Geschäfts-KPIs und AI-Leistungs-KPIs#

Abb. 1. Vergleich von Geschäfts-KPIs und AI-Leistungs-KPIs.
Wenn du an KPIs denkst, liegt die Annahme nahe, dass es dabei immer um Geschäftskennzahlen wie die Rendite der Investition (ROI), Kosteneinsparungen oder erzielte Umsätze geht – insbesondere bei Enterprise-AI. Diese Geschäfts-KPIs für AI messen, wie sich AI auf den Gesamterfolg eines Unternehmens auswirkt, und stehen im Einklang mit übergeordneten Geschäftszielen.
AI-Leistungs-KPIs konzentrieren sich dagegen darauf, wie gut das AI-System selbst funktioniert, und verwenden Kennzahlen wie Genauigkeit, Präzision und Recall. Auf die Details dieser Kennzahlen gehen wir weiter unten ein. Im Wesentlichen zeigen Geschäfts-KPIs zwar die finanziellen und strategischen Vorteile von AI auf, Leistungs-KPIs stellen jedoch sicher, dass ein AI-Modell seine Aufgabe effektiv erfüllt.
Bestimmte Kennzahlen können tatsächlich beiden Zwecken dienen. So können beispielsweise Effizienzgewinne, etwa eine Verringerung des Zeit- oder Ressourcenaufwands für die Erledigung einer Aufgabe, sowohl ein Leistungs-KPI (der zeigt, wie gut die AI-Lösung funktioniert) als auch ein Geschäfts-KPI (der Kosteneinsparungen und Produktivitätssteigerungen misst) sein. Die Kundenzufriedenheit ist eine weitere Kennzahl, die beiden Bereichen zugeordnet werden kann. Sie kann den Erfolg eines AI-gestützten Kundenservice-Tools sowohl im Hinblick auf seine technische Leistung als auch auf seine Auswirkungen auf die übergeordneten Geschäftsziele widerspiegeln.
Wichtige AI-Leistungskennzahlen verstehen#
Es gibt einige gängige Kennzahlen, mit denen sich die Leistung eines AI-Modells messen lässt. Zunächst sehen wir uns ihre Definition und Berechnung an. Anschließend betrachten wir, wie sich diese Kennzahlen überwachen lassen.
Präzision#
Präzision ist eine Kennzahl dafür, wie genau ein AI-Modell echte Positive erkennt (Fälle, in denen das Modell ein Objekt oder einen Zustand erwartungsgemäß korrekt identifiziert). In einem Gesichtserkennungssystem liegt beispielsweise ein echtes Positiv vor, wenn das System das Gesicht einer Person, zu dessen Erkennung es trainiert wurde, korrekt erkennt und identifiziert.
Um die Präzision zu berechnen, zählst du zunächst die Anzahl der echten Positiven. Anschließend teilst du diese durch die Gesamtzahl der Elemente, die das Modell als positiv gekennzeichnet hat. Diese Gesamtzahl umfasst sowohl korrekte Identifizierungen als auch Fehler, die als falsche Positive bezeichnet werden. Im Wesentlichen zeigt dir die Präzision, wie oft das Modell richtigliegt, wenn es behauptet, etwas erkannt zu haben.

Abb. 2. Präzision verstehen.
Sie ist besonders wichtig in Szenarien, in denen falsche Positive kostspielige oder störende Folgen haben können. In der automatisierten Fertigung zeigt eine hohe Präzisionsrate beispielsweise, dass das System fehlerhafte Produkte genauer markieren und verhindern kann, dass einwandfreie Produkte unnötig entsorgt oder nachbearbeitet werden. Ein weiteres gutes Beispiel ist die Sicherheitsüberwachung. Eine hohe Präzision hilft, Fehlalarme zu minimieren und sich auf tatsächliche Bedrohungen zu konzentrieren, die eine Sicherheitsmaßnahme erfordern.
Recall#
Recall hilft dabei, die Fähigkeit eines AI-Modells zu messen, alle relevanten Fälle oder echten Positiven in einem Datensatz zu erkennen. Einfach ausgedrückt zeigt Recall, wie gut ein AI-System alle tatsächlichen Fälle eines Zustands oder Objekts erfassen kann, zu dessen Erkennung es entwickelt wurde. Recall lässt sich berechnen, indem die Anzahl der korrekten Erkennungen durch die Gesamtzahl der positiven Fälle geteilt wird, die hätten erkannt werden müssen (dazu gehören sowohl die vom Modell korrekt erkannten als auch die übersehenen Fälle).
Betrachte ein AI-gestütztes medizinisches Bildgebungssystem, das zur Erkennung von Krebs eingesetzt wird. Recall gibt in diesem Zusammenhang den Prozentsatz der tatsächlichen Krebsfälle an, die das System korrekt erkennt. Ein hoher Recall ist in solchen Szenarien entscheidend, da das Übersehen einer Krebsdiagnose schwerwiegende Folgen für die Patientenversorgung haben kann.
Präzision im Vergleich zu Recall#
Präzision und Recall sind bei der Bewertung der Leistung eines AI-Modells wie zwei Seiten derselben Medaille und erfordern häufig ein ausgewogenes Verhältnis. Die Herausforderung besteht darin, dass eine Verbesserung der einen Kennzahl oft auf Kosten der anderen geht.
Nehmen wir an, du strebst eine höhere Präzision an. Das Modell wird möglicherweise selektiver und erkennt nur noch Positive, bei denen es sich sehr sicher ist. Wenn du dagegen den Recall verbessern möchtest, erkennt das Modell möglicherweise mehr Positive, darunter jedoch auch mehr falsche Positive, wodurch die Präzision sinken kann.
Entscheidend ist, je nach den spezifischen Anforderungen deiner Anwendung das richtige Gleichgewicht zwischen Präzision und Recall zu finden. Ein nützliches Hilfsmittel dafür ist die Precision-Recall-Kurve, die das Verhältnis zwischen den beiden Kennzahlen bei verschiedenen Schwellenwerten zeigt. Durch die Analyse dieser Kurve kannst du den optimalen Punkt bestimmen, an dem das Modell für deinen spezifischen Anwendungsfall die beste Leistung erbringt. Das Verständnis dieses Zielkonflikts hilft dir dabei, AI-Modelle fein abzustimmen, damit sie für ihre vorgesehenen Anwendungsfälle optimal funktionieren.

Abb. 3. Beispiel einer Precision-Recall-Kurve.
Mittlere durchschnittliche Präzision (mAP)#
Die mittlere durchschnittliche Präzision (mAP) ist eine Kennzahl zur Bewertung der Leistung von AI-Modellen bei Aufgaben wie der Objekterkennung, bei denen das Modell mehrere Objekte in einem Bild identifizieren und klassifizieren muss. mAP liefert dir einen einzelnen Wert, der zeigt, wie gut das Modell über alle verschiedenen Kategorien hinweg funktioniert, deren Erkennung es gelernt hat. Sehen wir uns an, wie dieser Wert berechnet wird.
Die Fläche unter einer Precision-Recall-Kurve ergibt die durchschnittliche Präzision (AP) für die jeweilige Klasse. AP misst, wie genau das Modell Vorhersagen für eine bestimmte Klasse trifft, wobei Präzision und Recall über verschiedene Konfidenzniveaus hinweg berücksichtigt werden (Konfidenzniveaus geben an, wie sicher sich das Modell bei seinen Vorhersagen ist). Nachdem die AP für jede Klasse berechnet wurde, wird mAP durch die Mittelung dieser AP-Werte über alle Klassen hinweg bestimmt.

Abb. 4. Die durchschnittliche Präzision verschiedener Klassen.
mAP ist in Anwendungen wie dem autonomen Fahren nützlich, bei denen mehrere Objekte wie Fußgänger, Fahrzeuge und Verkehrsschilder gleichzeitig erkannt werden müssen. Ein hoher mAP-Wert bedeutet, dass das Modell über alle Kategorien hinweg konstant gute Leistungen erbringt und dadurch in vielen verschiedenen Szenarien zuverlässig und präzise ist.
Leistungskennzahlen mühelos berechnen#
Die Formeln und Methoden zur Berechnung wichtiger AI-Leistungskennzahlen können einschüchternd wirken. Tools wie das Ultralytics-Paket machen dies jedoch einfach und schnell. Unabhängig davon, ob du an Aufgaben zur Objekterkennung, Segmentierung oder Klassifizierung arbeitest: Ultralytics stellt die erforderlichen Hilfsfunktionen bereit, um wichtige Kennzahlen wie Präzision, Recall und die mittlere durchschnittliche Präzision (mAP) schnell zu berechnen.
Um mit der Berechnung von Leistungskennzahlen mithilfe von Ultralytics zu beginnen, kannst du das Ultralytics-Paket wie unten gezeigt installieren.
Für dieses Beispiel laden wir ein vortrainiertes YOLOv8-Modell und verwenden es zur Validierung der Leistungskennzahlen. Du kannst jedoch jedes der unterstützten von Ultralytics bereitgestellten Modelle laden. So geht es:
Sobald das Modell geladen ist, kannst du eine Validierung deines Datensatzes durchführen. Mit dem folgenden Codeausschnitt kannst du verschiedene Leistungskennzahlen berechnen, darunter Präzision, Recall und mAP:
Mit Tools wie Ultralytics lassen sich Leistungskennzahlen deutlich einfacher berechnen. So kannst du mehr Zeit in die Verbesserung deines Modells investieren und musst dich weniger mit den Details des Bewertungsprozesses beschäftigen.
Wie wird die AI-Leistung nach der Bereitstellung gemessen?#
Bei der Entwicklung deines AI-Modells lässt sich seine Leistung leicht unter kontrollierten Bedingungen testen. Sobald das Modell jedoch bereitgestellt ist, kann die Situation komplizierter werden. Glücklicherweise gibt es Tools und bewährte Verfahren, die dir helfen können, deine AI-Lösung nach der Bereitstellung zu überwachen.
Tools wie Prometheus, Grafana und Evidently AI wurden entwickelt, um die Leistung deines Modells kontinuierlich zu überwachen. Sie können Einblicke in Echtzeit liefern, Anomalien erkennen und dich auf potenzielle Probleme aufmerksam machen. Diese Tools gehen über die herkömmliche Überwachung hinaus, indem sie automatisierte, skalierbare Lösungen anbieten, die sich an die dynamische Natur von AI-Modellen in Produktionsumgebungen anpassen.
Um den Erfolg deines AI-Modells nach der Bereitstellung zu messen, solltest du die folgenden bewährten Verfahren beachten:
- Klare Leistungskennzahlen festlegen: Lege wichtige Kennzahlen wie Genauigkeit, Präzision und Antwortzeit fest, um regelmäßig zu überprüfen, wie gut dein Modell funktioniert.
- Regelmäßig auf Daten-Drift prüfen: Achte auf Veränderungen in den Daten, die dein Modell verarbeitet, da diese seine Vorhersagen beeinträchtigen können, wenn sie nicht richtig berücksichtigt werden.
- A/B-Tests durchführen: Verwende A/B-Tests, um die Leistung deines aktuellen Modells mit neuen Versionen oder Anpassungen zu vergleichen. So kannst du Verbesserungen oder Verschlechterungen des Modellverhaltens quantitativ bewerten.
- Leistung dokumentieren und prüfen: Führe detaillierte Protokolle über Leistungskennzahlen und Änderungen an deinem AI-System. Dies ist für Audits, die Compliance und die kontinuierliche Verbesserung der Architektur deines Modells von entscheidender Bedeutung.
Die Auswahl optimaler AI-KPIs ist nur der Anfang#
Die erfolgreiche Bereitstellung und Verwaltung einer AI-Lösung hängt davon ab, die richtigen KPIs auszuwählen und aktuell zu halten. Insgesamt ist es entscheidend, Kennzahlen auszuwählen, die zeigen, wie gut die AI-Lösung technisch und im Hinblick auf ihre geschäftlichen Auswirkungen funktioniert. Wenn sich Dinge ändern, sei es durch technologische Fortschritte oder Veränderungen deiner Geschäftsstrategie, ist es wichtig, diese KPIs regelmäßig zu überprüfen und anzupassen.
Indem du deine Leistungsüberprüfungen dynamisch gestaltest, kannst du dein AI-System relevant und effektiv halten. Wenn du diese Kennzahlen kontinuierlich im Blick behältst, gewinnst du wertvolle Erkenntnisse, die zur Verbesserung deiner Abläufe beitragen. Ein proaktiver Ansatz stellt sicher, dass deine AI-Initiativen tatsächlich einen Mehrwert bieten und dein Unternehmen voranbringen!
Werde Teil unserer Community und entwickle gemeinsam mit uns Innovationen! Besuche unser GitHub-Repository, um unsere Fortschritte im Bereich AI zu sehen. Erfahre, wie wir mit wegweisender AI-Technologie Branchen wie die Fertigung und das Gesundheitswesen neu gestalten. 🚀









