Keypoints
Lerne, wie Keypoints die Objektgeometrie und Haltung in der KI definieren. Erforsche Pose Estimation mit Ultralytics YOLO26 und lege mit unserem benutzerfreundlichen Python SDK los.
Keypoints sind eindeutige räumliche Positionen oder Orientierungspunkte in einem Bild, die signifikante Merkmale eines Objekts oder Subjekts definieren. Im Kontext von Computer Vision und Machine Learning wird ein Keypoint typischerweise durch eine Reihe von Koordinaten (X, Y) dargestellt, die einen bestimmten Teil eines Objekts lokalisieren, wie zum Beispiel den Ellenbogen einer Person, die Ecke eines Gebäudes oder das Zentrum eines Autorads. Im Gegensatz zu einfacheren Aufgaben, die lediglich das Vorhandensein eines Objekts identifizieren, ermöglichen es Keypoints Artificial Intelligence (AI)-Modellen, die Geometrie, Haltung und strukturelle Anordnung des Subjekts zu verstehen. Diese Fähigkeit ist grundlegend für eine fortgeschrittene visuelle Analyse und versetzt Maschinen in die Lage, Körpersprache zu interpretieren, präzise Bewegungen zu verfolgen und digitale Overlays an realen Objekten auszurichten.
Die Rolle von Keypoints in KI-Modellen#
Keypoints dienen als grundlegende Daten für die Pose Estimation, eine Technik, die die Skelettstruktur eines Menschen oder Tieres abbildet. Durch das Erkennen einer vordefinierten Reihe von Punkten – wie Schultern, Knien und Knöcheln – können Algorithmen die vollständige Pose eines Subjekts in Echtzeit rekonstruieren. Dieser Prozess geht über die standardmäßige Object Detection hinaus, die normalerweise einen Bounding Box um ein Objekt ausgibt, ohne dessen interne Form zu verstehen.
Moderne Architekturen wie das hochmoderne Ultralytics YOLO26 haben sich weiterentwickelt, um diese Keypoints mit hoher Genauigkeit und Geschwindigkeit vorherzusagen. Diese Modelle nutzen Deep Learning (DL)-Netzwerke, die auf massiven annotierten Datensätzen wie COCO Keypoints trainiert wurden, um die visuellen Muster im Zusammenhang mit Gelenken und Gesichtsmerkmalen zu erlernen. Während der Inferenz regrediert das Modell die Koordinaten für jeden Keypoint, oft einschließlich eines Konfidenzwerts, um die Zuverlässigkeit der Vorhersage anzuzeigen.
Keypoints vs. verwandte Konzepte#
Es ist hilfreich, Keypoints von anderen gängigen Computer-Vision-Ausgaben zu unterscheiden, um ihren einzigartigen Nutzen zu verstehen:
- Keypoints vs. Bounding Boxes: Eine Bounding Box bietet eine grobe Lokalisierung, indem sie das gesamte Objekt in einem Rechteck umschließt. Keypoints ermöglichen eine feingranulare Lokalisierung spezifischer Teile innerhalb dieses Objekts.
- Keypoints vs. Image Segmentation: Die Image Segmentation klassifiziert jedes Pixel, um eine präzise Maske der Form des Objekts zu erstellen. Während die Segmentierung detaillierte Randinformationen bietet, liefern Keypoints eine strukturelle Zusammenfassung (ein „Skelett“), die für die Analyse von Bewegung und Kinematics oft effizienter ist.
- Keypoints vs. Feature Descriptors: In der traditionellen Bildverarbeitung wie SIFT (Scale-Invariant Feature Transform) sind Keypoints Interesspunkte (Ecken, Blobs), die für das Bildmatching verwendet werden. In der modernen DL-Pose-Estimation sind Keypoints semantische Labels (z. B. „linkes Handgelenk“), die vom Netzwerk erlernt werden.
Praxisanwendungen#
Die Fähigkeit, spezifische Körperteile oder Objektmerkmale zu verfolgen, eröffnet vielfältige Anwendungen in verschiedenen Branchen:
- Sportanalytik: Trainer und Athleten nutzen Pose Estimation, um die Biomechanik zu analysieren. Durch die Verfolgung von Keypoints an Gelenken können Systeme Winkel und Geschwindigkeiten berechnen, um die Technik in Sportarten wie Golf, Tennis oder Sprint zu verbessern. Sieh dir an, wie Ultralytics YOLO models track golf swings, um umsetzbares Feedback zu liefern.
- Gesundheitswesen und Rehabilitation: Physiotherapie-Plattformen nutzen Keypoints, um Patientenübungen aus der Ferne zu überwachen. Das System stellt sicher, dass Patienten während der Rehabilitationsroutinen die korrekte Form beibehalten, was das Verletzungsrisiko verringert und den Genesungsfortschritt verfolgt.
- Augmented Reality (AR): Social-Media-Filter und virtuelle Anprobe-Anwendungen verlassen sich auf Gesichts-Keypoints (Augen-, Nasen-, Mundkonturen), um digitale Masken oder Brillen sicher am Gesicht eines Nutzers zu verankern und die Ausrichtung beizubehalten, selbst wenn sich der Nutzer bewegt.
- Fahrerüberwachung: Fahrzeugsicherheitssysteme verfolgen Gesichtsmerkmale, um Anzeichen von Müdigkeit oder Ablenkung zu erkennen, und warnen den Fahrer, wenn seine Augen geschlossen sind oder seine Kopfposition auf einen Mangel an Aufmerksamkeit hindeutet.
Schlü Punkt-Erkennung mit Ultralytics YOLO26 implementieren#
Mit der Ultralytics Platform oder dem Python SDK können Entwickler die Keypoint-Erkennung einfach implementieren. Das folgende Beispiel zeigt, wie ein vortrainiertes YOLO26-pose model geladen und die Inferenz auf einem Bild ausgeführt wird, um menschliche Skelette zu erkennen.
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")Dieser einfache Workflow ermöglicht den schnellen Einsatz anspruchsvoller Computer Vision (CV)-Anwendungen. Für Benutzer, die ihre eigenen benutzerdefinierten Keypoint-Modelle trainieren möchten – beispielsweise um bestimmte Punkte an Industriemaschinen oder Tierarten zu erkennen –, vereinfacht die Ultralytics Platform den Prozess der Datenannotation und des Modelltrainings in der Cloud.
Fortgeschrittene Überlegungen#
Die erfolgreiche Bereitstellung der Keypoint-Erkennung erfordert die Bewältigung von Herausforderungen wie Verdeckung (wenn ein Körperteil verborgen ist) und unterschiedlichen Lichtverhältnissen. Moderne Modelle begegnen dem durch robustes Data Augmentation während des Trainings, wodurch das Netzwerk verschiedenen Szenarien ausgesetzt wird. Darüber hinaus ermöglicht die Integration von Keypoints mit Object Tracking-Algorithmen eine konsistente Identifizierung von Personen über die Zeit in Videostreams, was für Anwendungen wie Sicherheit oder Verhaltensanalyse unerlässlich ist.






