Keypoints
了解关键点如何定义 AI 中的对象几何结构和姿态。探索使用 Ultralytics YOLO26 进行姿态估计,并通过我们易于使用的 Python SDK 开始操作。
关键点是图像中定义对象或主体重要特征的独特空间位置或地标。在计算机视觉和机器学习领域,关键点通常表示为一组坐标(X、Y),用于精确定位对象的特定部位,例如人的肘部、建筑物的角落或汽车车轮的中心。与仅识别对象是否存在的简单任务不同,识别关键点可以让人工智能(AI)模型理解主体的几何结构、姿态和结构布局。这项能力是高级视觉分析的基础,使机器能够解读肢体语言、跟踪精确动作,并将数字叠加层与现实世界中的对象对齐。
关键点在 AI 模型中的作用#
关键点是姿态估计的基础数据,这项技术用于映射人类或动物的骨骼结构。通过检测预定义的一组点,例如肩部、膝盖和脚踝,算法可以实时重建主体的完整姿态。这一过程超越了标准的目标检测,后者通常只输出包围对象的边界框,而无法理解对象的内部形状。
现代架构(例如最先进的 Ultralytics YOLO26)已经发展到能够以很高的准确率和速度预测这些关键点。这些模型利用在海量标注数据集(例如 COCO 关键点)上训练的深度学习(DL)网络,学习与关节和面部特征相关的视觉模式。在推理过程中,模型会回归每个关键点的坐标,通常还会提供置信度分数,以表示预测的可靠性。
关键点与相关概念的比较#
将关键点与其他常见的计算机视觉输出区分开来,有助于理解其独特用途:
- 关键点与边界框:边界框提供粗略定位,用矩形框住整个对象。关键点则提供对象内部特定部位的细粒度定位。
- 关键点与图像分割:图像分割对每个像素进行分类,以创建对象形状的精确掩码。分割能够提供详细的边界信息,而关键点则提供结构摘要(“骨架”),通常更适合高效分析运动和运动学。
- **关键点与特征描述子:**在传统图像处理中,例如 SIFT(尺度不变特征变换),关键点是用于图像匹配的兴趣点(角点、斑点)。在现代 DL 姿态估计中,关键点是由网络学习得到的语义标签(例如“左手腕”)。
实际应用#
跟踪特定身体部位或对象特征的能力,为各行各业解锁了多种应用:
- **体育分析:**教练和运动员利用姿态估计分析生物力学。通过跟踪关节上的关键点,系统可以计算角度和速度,从而改进高尔夫、网球或短跑等运动中的技术。了解 Ultralytics YOLO 模型如何跟踪高尔夫挥杆,以获得可执行的反馈。
- **医疗与康复:**物理治疗平台利用关键点远程监测患者的锻炼情况。系统可确保患者在康复训练中保持正确姿势,降低受伤风险并跟踪恢复进度。
- **增强现实(AR):**社交媒体滤镜和虚拟试穿应用依靠面部关键点(眼睛、鼻子和嘴部轮廓)将数字面具或眼镜稳固地锚定在用户脸部,即使用户移动也能保持对齐。
- **驾驶员监控:**汽车安全系统跟踪面部地标,以检测困倦或分心迹象;如果驾驶员闭上眼睛,或其头部位置表明注意力不集中,系统就会发出警报。
使用 Ultralytics YOLO26 实现关键点检测#
开发者可以使用 Ultralytics Platform 或 Python SDK,轻松实现关键点检测。以下示例演示了如何加载预训练的 YOLO26-pose 模型,并对图像运行推理以检测人体骨骼。
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")这一简单工作流程可以快速部署复杂的计算机视觉(CV)应用。对于希望训练自定义关键点模型的用户(例如检测工业机械或动物物种上的特定点),Ultralytics Platform可简化云端的数据标注和模型训练流程。
高级注意事项#
要成功部署关键点检测,需要处理遮挡(身体部位被隐藏的情况)和多样化光照条件等挑战。现代模型会在训练期间通过强大的数据增强应对这些问题,使网络接触各种不同场景。此外,将关键点与目标跟踪算法集成,可以在视频流中持续识别个体,这对于安防或行为分析等应用至关重要。









