使用 Ultralytics YOLO11 改进手部关键点估计
探索 AI 驱动的手部关键点估计,了解 Ultralytics YOLO11 如何支持姿态估计,以及它在实时手势识别等应用中的用途。

最近,超级碗上的手语翻译员受到了广泛关注。当你在电视上看到他们用手语演绎你喜欢的艺人的歌曲时,如果你会手语,就能理解他们,因为你的大脑会处理他们的手部动作。但如果计算机也能做到同样的事情呢?得益于 AI 驱动的手部跟踪解决方案,机器现在可以高精度地跟踪和解读手部动作。
这些解决方案的核心是计算机视觉,这是 AI 的一个子领域,可以让机器处理和理解视觉信息。通过分析图像和视频,视觉 AI 可以帮助机器检测对象、跟踪动作,并以极高的准确度识别复杂手势。
例如,Ultralytics YOLO11 等计算机视觉模型可以通过姿态估计进行训练,从而实时检测和分析手部关键点。这样一来,这些模型就可以应用于手势识别、手语翻译以及 AR/VR 交互等场景。
本文将介绍 Ultralytics YOLO11 如何实现基于 AI 的手部跟踪、用于训练的数据集,以及如何自定义训练手部姿态估计模型。我们还将了解一些实际应用。现在开始吧!
了解基于 AI 的手部关键点检测#
AI 可以通过识别手腕、指尖和指关节等关键点,在视觉数据中识别和跟踪手部动作。一种称为姿态估计的方法可以通过映射关键点并分析其随时间的变化,帮助计算机理解人体运动。这样,AI 系统就能高精度地解读身体姿态、手势和运动模式。
计算机视觉模型通过分析图像或视频来识别手部关键点并跟踪其运动,从而实现这一功能。映射出这些点后,AI 可以通过分析关键点之间的空间关系及其随时间的变化来识别手势。
例如,如果拇指和食指之间的距离缩小,AI 就可以将其解读为捏取动作。同样,通过跟踪关键点在一系列动作中的移动情况,还可以识别复杂的手势,甚至预测未来的动作。

图 1. 使用计算机视觉识别手部关键点的示例。
有趣的是,用于手部跟踪的姿态估计带来了许多令人振奋的可能性,从免提控制智能设备,到提升机器人操作精度,再到辅助医疗应用。随着 AI 和计算机视觉不断发展,手部跟踪可能会在日常生活中发挥越来越重要的作用,让技术变得更具交互性、更易使用,也更直观。
探索用于姿态估计的 Ultralytics YOLO11#
在深入了解如何创建基于 AI 的手部跟踪解决方案之前,我们先来看看姿态估计,以及 Ultralytics YOLO11 如何支持这项计算机视觉任务。与识别完整对象的标准对象检测不同,姿态估计侧重于检测关节、肢体或边缘等关键标志点,以分析动作和姿态。
具体来说,Ultralytics YOLO11 专为实时姿态估计而设计。通过结合自顶向下和自底向上的方法,它可以高效地检测人物并在一个步骤中估计关键点,在速度和准确度方面都优于之前的模型。
开箱即用的 Ultralytics YOLO11 已在 COCO-Pose 数据集上完成预训练,可以识别人类身体上的关键点,包括头部、肩部、肘部、手腕、髋部、膝盖和脚踝。

图 2. 使用 YOLO11 进行人体姿态估计。
除了人体姿态估计之外,Ultralytics YOLO11 还可以通过自定义训练,检测各种有生命和无生命对象上的关键点。这种灵活性使 YOLO11 成为众多应用场景的理想选择。
Hand Keypoints 数据集概览#
自定义训练模型的第一步是收集数据并进行标注,或者找到符合项目需求的现有数据集。例如,Hand Keypoints 数据集是训练用于手部跟踪和姿态估计的视觉 AI 模型的良好起点。它包含 26,768 张已标注图像,因此无需手动标注。
你可以使用它训练 Ultralytics YOLO11 等模型,使模型快速学会检测和跟踪手部动作。该数据集为每只手提供 21 个关键点,涵盖手腕、手指和关节。此外,数据集的标注由 Google MediaPipe 生成。Google MediaPipe 是一个用于开发 AI 驱动实时媒体处理解决方案的工具,可确保关键点检测准确可靠。

图 3. Hand Keypoints 数据集中包含的 21 个关键点。
使用这样的结构化数据集可以节省时间,让开发者专注于训练和微调模型,而不是收集和标注数据。事实上,该数据集已经划分为训练子集(18,776 张图像)和验证子集(7,992 张图像),可以轻松评估模型性能。
如何训练用于手部姿态估计的 Ultralytics YOLO11#
使用 Ultralytics Python 软件包训练 YOLO11 进行手部姿态估计非常简单,因为该软件包可以让模型的设置和训练更加轻松。由于 Hand Keypoints 数据集已经获得训练流水线的支持,因此无需额外格式处理即可立即使用,从而节省时间和精力。
下面介绍训练流程:
- 设置环境:第一步是安装 Ultralytics Python 软件包。
- 加载 Hand Keypoints 数据集:Ultralytics YOLO11 原生支持该数据集,因此可以自动下载并准备。
- **使用预训练模型:**你可以从预训练的 Ultralytics YOLO11 姿态估计模型开始,这有助于提高准确度并加快训练过程。
- **训练模型:**模型会经过多个训练周期,学习检测和跟踪手部关键点。
- **监控性能:**Ultralytics 软件包还提供用于跟踪准确度和损失等关键指标的内置工具,帮助确保模型随时间不断改进。
- **保存并部署:**训练完成后,可以导出模型,并将其用于实时手部跟踪应用。
评估你的自定义训练模型#
在完成自定义模型的创建步骤时,你会注意到监控性能至关重要。除了跟踪训练过程中的进度之外,训练完成后评估模型也非常关键,以确保它能够准确检测和跟踪手部关键点。
准确度、损失值和平均精度均值(mAP)等关键性能指标有助于评估模型的表现。Ultralytics Python 软件包提供了用于可视化结果以及将预测结果与真实标注进行比较的内置工具,让你更容易发现需要改进的地方。
为了更好地了解模型的性能,你可以查看损失曲线、精确率-召回率图和混淆矩阵等评估图表,这些图表会在训练日志中自动生成。
这些图表有助于发现过拟合问题(模型记住了训练数据,却难以处理新数据)或欠拟合问题(模型未能充分学习模式,因而无法准确执行任务),并指导你进行调整以提高准确度。此外,在新图像或视频上测试模型也很重要,这样才能了解它在真实场景中的表现。
AI 驱动的手部跟踪解决方案的应用#
接下来,我们来了解一些最具影响力的使用 Ultralytics YOLO11 进行手部关键点估计应用。
使用 Ultralytics YOLO11 实现实时手势识别#
假设你只需挥挥手就能调节电视音量,或者在空中简单一挥就能操作智能家居系统。Ultralytics YOLO11 驱动的实时手势识别可以准确检测手部动作,让这些无需触摸的交互成为可能。
这一过程通过AI 摄像头跟踪手部关键点,并将手势解读为指令来实现。深度感知摄像头、红外传感器,甚至普通网络摄像头都可以捕捉手部动作,而 Ultralytics YOLO11 则可以处理这些数据,识别不同手势。例如,这样的系统可以区分用于切换歌曲的挥动、用于放大的捏合,以及用于调节音量的圆周运动。
基于 AI 的手部关键点检测用于手语识别#
手部跟踪 AI 解决方案可以支持聋人与不会手语的人之间的无障碍交流。例如,集成摄像头和 Ultralytics YOLO11 的智能设备可以将手语即时翻译成文字或语音。
得益于 Ultralytics YOLO11 等技术进步,手语翻译工具正变得更加准确且易于使用。这会影响辅助技术、实时翻译服务和教育平台等应用。AI 可以帮助弥合沟通障碍,促进工作场所、学校和公共空间的包容性。
用于手部跟踪的计算机视觉:改善 AR 和 VR 体验#
你是否玩过可以不用控制器就抓取物体的虚拟现实(VR)游戏?计算机视觉驱动的手部跟踪让用户能够在增强现实(AR)和 VR 环境中自然交互,从而实现这一功能。

图 4. 手部跟踪是 AR 和 VR 应用的关键组成部分。
借助 Ultralytics YOLO11 等模型进行手部关键点估计,AI 可以实时跟踪动作,实现捏合、抓取和挥动等手势。这可以增强游戏、虚拟培训和远程协作体验,让交互更加直观。随着手部跟踪技术不断改进,AR 和 VR 将变得更加沉浸和逼真。
要点总结#
使用 Ultralytics YOLO11 进行手部关键点估计,正让 AI 驱动的手部跟踪解决方案变得更加易用和可靠。从实时手势识别到手语解读以及 AR/VR 应用,计算机视觉正在为人机交互开启新的可能性。
此外,简化的自定义训练和微调流程正在帮助开发者为各种真实应用构建高效模型。随着计算机视觉技术不断发展,我们可以期待医疗、机器人、游戏和安防等领域出现更多创新。
加入我们的社区,并在我们的 GitHub repository 中探索 AI 的最新进展。通过我们的解决方案页面,了解 AI in manufacturing 和 computer vision in healthcare 所带来的影响。探索我们的许可方案,今天就开启你的 AI 之旅!









