Pose Estimation
了解姿态估计如何使用关键点跟踪运动。探索实际应用,并开始使用 Ultralytics YOLO26 获得快速、准确的结果。
姿态估计是一种专业的计算机视觉技术,它不仅能检测物体是否存在,还能理解物体的几何结构和物理朝向。标准的目标检测会在目标周围绘制一个简单的矩形框,而姿态估计则会识别特定的语义点,即所谓的关键点,例如人体上的关节(肘部、膝盖、肩部)或车辆的结构拐角。通过映射这些地标点,机器学习模型可以重建目标的骨骼表示,使系统能够解读肢体语言、运动动态以及目标在二维或三维空间中的精确位置。
核心机制:自顶向下与自底向上#
现代姿态估计高度依赖先进的深度学习架构,通常使用卷积神经网络 (CNNs)处理视觉数据。用于识别关键点的算法通常遵循两种主要策略之一:
- 自顶向下方法:这种方法首先使用目标检测模型,在边界框中定位单个实例。将人员或物体从较大的图像中裁剪出来后,姿态估计器会预测该特定区域内的关键点。这种方法通常具有很高的准确率,但随着画面中目标数量增加,可能会出现更高的推理延迟。
- 自底向上方法:相反,这种策略会同时检测整幅图像中的所有潜在关键点(例如,在人群中找出每个“左膝”),然后使用关联算法将它们分组为单个骨架。由于无论画面中有多少人,计算成本都相对稳定,因此这种方法通常更适合在拥挤场景中进行实时推理。
YOLO26等先进模型采用先进的端到端架构,在这些需求之间取得平衡,提供适用于部署在边缘 AI设备和移动平台上的高速姿态估计。
区分相关的计算机视觉术语#
为了理解姿态估计在计算机视觉工作流中的独特价值,了解它与其他视觉识别任务之间的区别会很有帮助:
- 目标检测:重点识别物体是什么以及位于哪里,并输出一个矩形框。它将目标视为刚性物体,而不理解其内部的关节结构。
- 实例分割:生成像素级精确的掩码,勾勒出物体的精确形状。虽然分割能够提供边界,但它不会明确识别运动学分析所需的关节或骨骼连接。
- 姿态估计:专门针对内部结构,通过映射预定义地标点之间的连接(例如从髋部到膝盖)来分析姿势和动作。
实际应用#
将人和物体的运动数字化的能力,推动了各行各业的变革性应用。这些应用通常使用Ultralytics Platform等工具进行训练,以管理包含大量已标注关键点的数据集。
医疗与康复#
在医疗领域,医疗领域的 AI利用姿态估计远程监测患者康复情况。通过跟踪关节角度和活动范围,自动化系统可以确保患者在家中正确完成物理治疗练习。这能降低再次受伤的风险,同时让临床医生无需昂贵的实验室设备即可量化康复进展。
体育分析#
教练和运动员借助体育分析来优化表现。姿态估计模型可以分析高尔夫球手的挥杆平面、跑步者的步幅长度或投手的生物力学,而无需穿戴传统动作捕捉中使用的侵入式标记服。这能提供即时的数据驱动反馈,帮助改进技术并预防过度使用造成的损伤。
零售与行为分析#
在商业环境中,零售领域的 AI系统使用姿态检测来了解客户行为,例如伸手拿取高处货架上的商品,或在特定过道停留。这些数据通过将身体动作与购买决策相关联,帮助优化店铺布局并改进库存管理。
代码示例:使用 Ultralytics YOLO26 进行姿态估计#
借助现代Python框架,实现姿态估计非常简单。以下示例演示了如何使用 ultralytics 软件包加载一个预训练的 YOLO26模型(YOLO11的后继版本),并检测图像中的人体关键点。
from ultralytics import YOLO
# Load the YOLO26 pose model (nano version for speed)
model = YOLO("yolo26n-pose.pt")
# Perform inference on an image source
# The model identifies bounding boxes and specific keypoints (joints)
results = model("https://ultralytics.com/images/bus.jpg")
# Print the xy coordinates of detected keypoints
print(results[0].keypoints.xy)
# Visualize the skeletal results directly
results[0].show()








