Keypoints
Erfahre, wie Keypoints die Geometrie und Körperhaltung von Objekten in der KI definieren. Entdecke die Posenschätzung mit Ultralytics YOLO26 und beginne mit unserem benutzerfreundlichen Python SDK.
Keypoints sind eindeutig bestimmbare räumliche Positionen oder Orientierungspunkte innerhalb eines Bildes, die wichtige Merkmale eines Objekts oder Motivs definieren. Im Kontext von Computer Vision und maschinellem Lernen wird ein Keypoint typischerweise durch einen Satz von Koordinaten (X, Y) dargestellt, die auf einen bestimmten Teil eines Objekts verweisen, etwa den Ellbogen einer Person, die Ecke eines Gebäudes oder die Mitte eines Autorads. Anders als bei einfacheren Aufgaben, die lediglich das Vorhandensein eines Objekts erkennen, ermöglichen Keypoints künstlicher Intelligenz (AI)-Modellen, die Geometrie, Körperhaltung und strukturelle Anordnung des Motivs zu verstehen. Diese Fähigkeit ist grundlegend für fortgeschrittene visuelle Analysen und ermöglicht es Maschinen, Körpersprache zu interpretieren, präzise Bewegungen zu verfolgen und digitale Einblendungen an realen Objekten auszurichten.
Die Rolle von Keypoints in AI-Modellen#
Keypoints bilden die Grundlage für die Posenschätzung, eine Technik, die die Skelettstruktur eines Menschen oder Tiers abbildet. Durch die Erkennung einer vordefinierten Menge von Punkten – etwa Schultern, Knien und Knöcheln – können Algorithmen die vollständige Pose eines Motivs in Echtzeit rekonstruieren. Dieser Prozess geht über die herkömmliche Objekterkennung hinaus, die typischerweise eine Begrenzungsbox um ein Objekt ausgibt, ohne dessen innere Form zu verstehen.
Moderne Architekturen wie das hochmoderne Ultralytics YOLO26 wurden weiterentwickelt, um diese Keypoints mit hoher Genauigkeit und Geschwindigkeit vorherzusagen. Diese Modelle nutzen Deep-Learning (DL)-Netzwerke, die mit umfangreichen annotierten Datensätzen wie COCO Keypoints trainiert wurden, um visuelle Muster zu erlernen, die mit Gelenken und Gesichtsmerkmalen verbunden sind. Während der Inferenz regressiert das Modell die Koordinaten jedes Keypoints und gibt häufig zusätzlich einen Konfidenzwert aus, der die Zuverlässigkeit der Vorhersage angibt.
Keypoints im Vergleich zu verwandten Konzepten#
Um ihren besonderen Nutzen zu verstehen, ist es hilfreich, Keypoints von anderen gängigen Ausgaben von Computer-Vision-Systemen zu unterscheiden:
- Keypoints im Vergleich zu Begrenzungsboxen: Eine Begrenzungsbox ermöglicht eine grobe Lokalisierung und umschließt das gesamte Objekt in einem Rechteck. Keypoints ermöglichen eine feingranulare Lokalisierung bestimmter Teile innerhalb dieses Objekts.
- Keypoints im Vergleich zur Bildsegmentierung: Die Bildsegmentierung klassifiziert jedes Pixel, um eine präzise Maske der Objektform zu erstellen. Während die Segmentierung detaillierte Informationen über die Begrenzung liefert, bieten Keypoints eine strukturelle Zusammenfassung (ein „Skelett“), die häufig effizienter für die Analyse von Bewegungen und Kinematik ist.
- Keypoints im Vergleich zu Merkmalsdeskriptoren: In der klassischen Bildverarbeitung, etwa bei SIFT (skalierungsinvariante Merkmalstransformation), sind Keypoints interessante Punkte (Ecken, Flecken), die für den Bildabgleich verwendet werden. Bei der modernen Posenschätzung mit DL sind Keypoints semantische Bezeichnungen (z. B. „linkes Handgelenk“), die vom Netzwerk erlernt werden.
Anwendungen in der Praxis#
Die Möglichkeit, bestimmte Körperteile oder Objektmerkmale zu verfolgen, eröffnet vielfältige Anwendungen in unterschiedlichen Branchen:
- Sportanalyse: Trainer und Sportler nutzen Posenschätzung zur Analyse der Biomechanik. Durch die Verfolgung von Keypoints an Gelenken können Systeme Winkel und Geschwindigkeiten berechnen, um die Technik in Sportarten wie Golf, Tennis oder Sprint zu verbessern. Sieh dir an, wie Ultralytics YOLO-Modelle Golfschwünge verfolgen, um umsetzbares Feedback zu liefern.
- Gesundheitswesen und Rehabilitation: Plattformen für Physiotherapie nutzen Keypoints, um Übungen von Patienten aus der Ferne zu überwachen. Das System stellt sicher, dass Patienten während ihrer Rehabilitationsübungen die korrekte Körperhaltung beibehalten, verringert das Verletzungsrisiko und verfolgt den Genesungsfortschritt.
- Erweiterte Realität (AR): Filter für soziale Medien und Anwendungen zur virtuellen Anprobe nutzen Gesichts-Keypoints (Augen, Nase und Mundkonturen), um digitale Masken oder Brillen sicher am Gesicht des Nutzers zu verankern und ihre Ausrichtung auch bei Bewegungen beizubehalten.
- Fahrerüberwachung: Fahrzeugsicherheitssysteme verfolgen Gesichtsmerkmale, um Anzeichen von Müdigkeit oder Ablenkung zu erkennen, und warnen den Fahrer, wenn sich seine Augen schließen oder seine Kopfposition auf mangelnde Aufmerksamkeit hindeutet.
Keypoint-Erkennung mit Ultralytics YOLO26 implementieren#
Mit der Ultralytics Platform oder dem Python SDK können Entwickler die Keypoint-Erkennung einfach implementieren. Das folgende Beispiel zeigt, wie ein vortrainiertes YOLO26-pose-Modell geladen und eine Inferenz auf einem Bild ausgeführt wird, um menschliche Skelette zu erkennen.
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")Dieser einfache Arbeitsablauf ermöglicht die schnelle Bereitstellung anspruchsvoller Anwendungen für Computer Vision (CV). Nutzer, die eigene benutzerdefinierte Keypoint-Modelle trainieren möchten – beispielsweise zur Erkennung bestimmter Punkte an Industriemaschinen oder Tierarten –, können den Prozess der Datenannotation und des Modelltrainings in der Cloud mit der Ultralytics Platform vereinfachen.
Weiterführende Überlegungen#
Eine erfolgreiche Bereitstellung der Keypoint-Erkennung erfordert den Umgang mit Herausforderungen wie Verdeckungen (wenn ein Körperteil verborgen ist) und unterschiedlichen Lichtverhältnissen. Moderne Modelle begegnen diesen Herausforderungen durch robuste Datenerweiterung während des Trainings, bei der das Netzwerk verschiedenen Szenarien ausgesetzt wird. Darüber hinaus ermöglicht die Integration von Keypoints in Algorithmen zur Objektverfolgung die konsistente Identifizierung von Personen über längere Zeiträume in Videostreams – eine wesentliche Voraussetzung für Anwendungen wie Sicherheit oder Verhaltensanalyse.









