Ultralytics YOLO27:
指南

什么是姿态估计,以及它可以应用于哪些场景?

了解姿态估计的工作原理及其真实应用,以及 Ultralytics YOLO11 等模型如何帮助机器理解身体动作和姿态。

ABAbirami Vina7 min read
什么是姿态估计,以及它可以应用于哪些场景

当你看到有人弓背垂肩,或昂首挺胸、肩膀后展时,你能立刻判断出他们的姿态是懒散还是自信。没人需要向你解释。这是因为随着时间的推移,我们自然学会了解读肢体语言。

通过经验和观察,我们的大脑已经非常擅长识别各种物体(包括人类)的姿态。得益于人工智能(AI)和计算机视觉领域的最新进展,机器能够解读来自现实世界的视觉信息,如今也开始学习并复现这种能力。

姿态估计是一项计算机视觉任务,能够帮助机器通过分析图像或视频来确定人物或物体的位置和方向。它通过识别身体上的关键点(如关节和四肢)来理解人甚至物体是如何运动的。

这项技术正广泛应用于健身、医疗保健和动画等领域。例如,在工作场所,它可以用于监测员工姿态,支持安全与健康计划。借助Ultralytics YOLO11等计算机视觉模型,系统可以实时估计人体姿态。

使用 Ultralytics YOLO11 监测工人姿态

图 1。使用 Ultralytics YOLO11 监测工人姿态的示例。

本文将深入介绍姿态估计及其工作原理,并探讨它正在产生实际影响的真实应用场景。让我们开始吧!

姿态估计的发展历程#

姿态估计研究始于 20 世纪 60 年代末和 70 年代。多年来,这项计算机视觉任务所采用的方法已从基础数学和几何方法,发展为由人工智能驱动的更先进方法。

最初,这些技术依赖固定的摄像机角度和已知的参考点。后来,它们逐步引入 3D 模型和特征匹配。如今,Ultralytics YOLO11 等深度学习模型可以从图像或视频中实时检测身体位置,使姿态估计比以往更快速、更准确。

随着技术不断进步,研究人员发现,监测和跟踪各种物体(尤其是人类和动物)姿态具有很大的应用潜力。姿态估计尤为重要,因为它让 AI 工具能够以过去无法实现的方式理解和测量姿态与运动。

例如,它可以让计算机识别手势,实现免手操作;分析运动员的动作,帮助提升表现;为视频游戏提供逼真的动画;甚至通过跟踪患者的康复进展来支持医疗保健。

它与其他计算机视觉任务有何不同?#

姿态估计不同于目标检测和实例分割等其他计算机视觉任务。这些任务主要专注于识别和定位图像中的物体。

例如,目标检测会在人物、车辆或动物等物体周围绘制边界框,以表示它们是否存在及其位置。实例分割则更进一步,在像素级别勾勒出每个物体的精确形状。

不过,这两种方法主要关注物体是什么以及位于哪里,并不会提供物体姿态或其可能正在进行的动作方面的信息。这正是姿态估计发挥关键作用的地方。

通过识别身体上的关键点(如肘部、膝盖,甚至尾巴),姿态估计可以解读姿态和运动。这让我们能够更深入地理解动作、手势和身体动态,包括 3D 空间中的运动。

了解姿态估计的工作原理#

姿态估计模型通常采用两种主要方法:自底向上和自顶向下。在自底向上方法中,模型首先检测单独的关键点(如肘部、膝盖或肩膀),然后将它们分组,以确定其所属的人物或物体。相比之下,自顶向下方法先检测每个物体(例如图像中的人物),然后定位该特定物体的关键点。

自底向上与自顶向下的姿态估计方法

图 2。自底向上与自顶向下的姿态估计方法。

一些较新的模型(如 Ultralytics YOLO11)融合了这两种方法的优势。它跳过手动分组步骤,保留了自底向上方法的高效性;同时通过一次性检测人物并估计其姿态,借助自顶向下系统的精确性,在一个简洁流畅的流程中完成全部操作。

针对姿态估计自定义训练 Ultralytics YOLO11#

在了解姿态估计模型的工作原理时,你可能会想:这些模型究竟是如何学会估计不同物体的姿态的?这就要介绍自定义训练的概念了。

自定义训练是指使用你自己的数据,教模型识别特定的关键点。由于从头构建模型需要大量带标注的图像和大量时间,许多人会选择迁移学习。具体来说,就是从一个已经在大型数据集上训练好的模型开始,例如在COCO-Pose 数据集上预训练的 Ultralytics YOLO11 姿态估计模型,然后使用你自己的数据针对特定任务或应用场景对其进行微调。

假设你正在处理瑜伽姿势,你可以使用每个姿势都标注了该活动特定关键点的图像来微调 Ultralytics YOLO11。为此,你需要一个模型可以从中学习的自定义数据集,其中包含经过标注的图像。

在训练期间,你可以调整批量大小(一次处理的图像数量)、学习率(模型更新学习结果的速度)和训练轮数(模型遍历数据集的次数)等设置,以提升准确率。这样可以更轻松地构建满足特定需求的姿态估计模型。

姿态估计的真实应用#

现在我们已经讨论了姿态估计是什么以及它如何工作,接下来深入了解一些真实应用场景。

使用姿态估计进行物理治疗#

姿态估计正逐渐成为医疗保健行业中的可靠工具,尤其是在物理治疗领域。借助 AI 和计算机视觉,这些系统可以实时跟踪姿态和动作,并提供类似物理治疗师所能提供的反馈。

例如,膝关节手术后的患者可以使用姿态估计系统,确保自己正确完成康复训练。系统能够发现错误动作并提出改进建议,帮助患者坚持训练计划并避免受伤。

使用 Ultralytics YOLO11 进行物理治疗

图 3。使用 Ultralytics YOLO11 进行物理治疗的示例。

除了康复之外,姿态估计也开始应用于健身应用。例如,在家锻炼的人可以使用应用检查运动时的动作姿势。应用可以提供实时反馈,例如调整深蹲角度,或确保你在进行硬拉时背部挺直。这能帮助用户改善动作姿势并预防受伤,而无需教练指导。

姿态估计赋能娱乐行业的动作捕捉#

姿态估计改变了娱乐行业中的动作捕捉方式,使其变得更简单、更易使用。过去,动作捕捉需要在人体上放置标记,再用特殊摄像机跟踪这些标记,这一过程可能既复杂又昂贵。

如今,随着 AI 和计算机视觉的发展,我们可以使用普通摄像机和算法跟踪身体动作,无需标记物,从而让整个过程更加高效、准确,甚至可以实时完成。

Disney 的 AR(增强现实)Poser就是一个很好的例子。这个有趣的工具可以让你用手机拍照,并让一个数字角色在增强现实中模仿你的姿势。它通过分析照片中的姿态,并将其匹配到 3D 角色上,生成有趣且个性化的 AR 自拍照。

一个 AR 角色使用姿态估计模仿人物姿势

图 4。一个 AR 角色使用姿态估计模仿人物姿势。

动物姿态估计驱动的社会行为研究#

研究动物行为有助于科学家了解动物如何交流、寻找配偶、照料幼崽以及群体生活。这些知识对于保护野生动物和深入理解自然世界至关重要。

姿态估计通过利用图像和视频跟踪动物的动作与姿态,简化了这一过程,而且无需在动物身上安装传感器或标签。这些系统可以自动监测动物姿态,从而洞察梳理、玩耍或打斗等行为。

一个有趣的例子是,科学家使用姿态估计研究类人猿行为。事实上,研究人员已经整理出了 OpenApePose 等数据集,其中包含来自六种类人猿的 71,000 多张带标注图像。

类人猿姿态估计

图 5。类人猿姿态估计。

姿态估计的优缺点#

以下是姿态估计能够为各个行业带来的一些主要优势:

  • 可扩展性 姿态估计系统可以部署在各种设备上,从智能手机到先进的摄像机系统,因此能够高度扩展,并适用于不同的应用场景和环境。
  • 成本效益: 由于姿态估计依赖普通摄像机,不需要昂贵的传感器或标签,因此在研究和商业应用中跟踪动作时,可以成为更具成本效益的解决方案。
  • 持续监测: 姿态估计系统可以提供持续的实时跟踪,从而监测一段时间内的变化,无论是康复中的患者进展,还是野外动物行为的跟踪。

虽然姿态估计在各个领域的优势显而易见,但也存在一些需要考虑的挑战。以下是需要注意的几个主要限制:

  • 泛化能力有限: 许多在人体数据集上训练的模型,如果不使用特定数据集重新训练,就无法很好地泛化到动物或不常见的身体结构。

  • 环境限制: 在光线不足、快速运动造成的模糊或背景杂乱的情况下,性能可能会下降。

  • 对遮挡高度敏感: 当身体部位被遮挡或处于画面外时,准确率可能会下降,尤其是在拥挤场景或多人跟踪中。

要点总结#

姿态估计已经从早期阶段取得了长足发展,从使用标记物的系统演变为由 Ultralytics YOLO11 等深度学习模型驱动的高影响力工具。无论是改善物理治疗、支持交互式 AR 体验,还是助力野生动物研究,姿态估计都在改变机器理解运动和姿态的方式。随着技术不断进步,解决其局限性将成为释放更多实用应用的关键,并让机器更好地理解我们以及其他生物是如何运动的。

对 AI 感兴趣?探索我们的 GitHub 代码仓库,加入我们的社区,并查看我们的许可选项,开启你的计算机视觉项目。你还可以在我们的解决方案页面中,进一步了解零售行业中的 AI物流行业中的计算机视觉等创新应用。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅