计算机视觉任务须知
了解目标跟踪、实例分割和图像分类等计算机视觉任务的工作原理,以及 Ultralytics YOLO11 如何支持这些任务。

得益于摄像头和人工智能(AI)的发展,计算机和机器现在能够以类似人类的方式看见这个世界。例如,它们可以识别人、跟踪物体,甚至理解视频中正在发生的事情。
具体来说,计算机视觉是 AI 的一个分支,使机器能够理解和解释周围世界中的视觉信息。计算机视觉包含多种任务,每种任务都旨在从图像或视频中提取特定类型的信息。例如,目标检测有助于识别图片中的不同物体并确定其位置,而跟踪、分割和姿态估计等其他任务则帮助机器更准确地理解运动、形状和位置。
特定应用所使用的计算机视觉任务取决于你需要哪类信息。像 Ultralytics YOLO11 这样的计算机视觉模型支持多种计算机视觉任务,因此是构建真实世界视觉 AI 系统的可靠选择。
在本指南中,我们将深入了解 YOLO11 等模型支持的计算机视觉任务。我们会探讨每项任务的工作方式,以及它们如何应用于不同行业。让我们开始吧!
什么是计算机视觉任务?#
计算机视觉任务旨在以不同方式复现人类的视觉能力。这些任务可以帮助机器检测物体、跟踪其运动、估计姿态,甚至勾勒出图像和视频中的独立元素。通常,计算机视觉任务由模型提供支持,这些模型会将视觉数据分解成更小的部分,从而更清晰地解释正在发生的事情。
像 Ultralytics YOLO 模型这样的视觉 AI 模型支持在一个框架中完成检测、跟踪和分割等多种任务。得益于这种多功能性,YOLO11 模型易于应用于各种用例。

图 1。Ultralytics YOLO11 支持的计算机视觉任务。
体育分析就是一个很好的例子。你可以使用 YOLO11 通过目标检测识别场上的每名球员,然后通过目标跟踪在整场比赛中跟随他们。同时,YOLO11 的姿态估计功能可以帮助分析球员的动作和技术,而实例分割则可以将每名球员与背景分离,从而提高分析的精度。
这些由 YOLO11 支持的计算机视觉任务结合起来,可以完整呈现比赛期间发生的情况,为球队提供有关球员表现、战术和整体策略的更深入洞察。
Ultralytics YOLO11 支持的计算机视觉任务概览#
现在我们已经了解了计算机视觉任务是什么,接下来将结合真实世界的示例,详细了解 YOLO11 支持的每项任务。
Ultralytics YOLO11 对图像分类的支持#
当你看到一张照片时,大多数人都能轻松判断其中是狗、山还是交通标志,因为我们都已经学会了这些事物通常是什么样子。图像分类通过教机器根据图像中的主要物体对图像进行分类和标注,帮助机器完成同样的任务——无论标签是“汽车”“香蕉”还是“骨折 X 光片”。这一标签可以帮助计算机视觉系统理解视觉内容,从而做出相应响应或决策。
这项计算机视觉任务的一个有趣应用是野生动物监测。图像分类可用于根据野外拍摄的照片识别不同的动物物种。通过自动标注图像,研究人员可以更轻松地追踪种群数量、监测迁徙模式并识别濒危物种,从而支持保护工作。

图 2。使用 YOLO11 进行图像分类的示例。
Ultralytics YOLO11 的目标检测能力#
图像分类有助于整体了解图像包含的内容,但它只会为整张图像分配一个标签。当需要精确信息(例如多个物体的准确位置和身份)时,目标检测就变得必不可少。
目标检测是识别和定位图像中独立物体的过程,通常通过在物体周围绘制边界框来实现。Ultralytics YOLO11 尤其擅长实时目标检测,因此非常适合广泛的应用。
以零售店用于货架补货的计算机视觉解决方案为例。目标检测可以帮助清点水果、蔬菜和其他商品,确保库存准确。在农业领域,同样的技术可以监测作物成熟度,帮助农民确定最佳收获时间,甚至区分成熟和未成熟的农产品。
图 3。使用 Ultralytics YOLO11 检测水果。
使用 YOLO11 进行实例分割#
目标检测使用边界框识别和定位图像中的物体,但无法捕捉物体的精确形状。这正是实例分割发挥作用的地方。实例分割不是在物体周围绘制方框,而是描摹物体的精确轮廓。
你可以这样理解:它不是简单地指出“这个区域里有一个苹果”,而是仔细勾勒并填充苹果的准确形状。这一详细过程可以帮助 AI 系统清晰地理解物体边界,尤其是在多个物体彼此靠近时。
实例分割可以应用于从基础设施检查到地质调查的众多场景。例如,可以使用 YOLO11 分割地质调查数据中的大面积和小面积表面裂缝或异常。通过在这些异常周围绘制精确边界,工程师可以定位问题,并在项目开始前予以处理。

图 4。YOLO11 支持的裂缝分割。
目标跟踪:使用 YOLO11 跨帧跟踪物体#
到目前为止,我们讨论的计算机视觉任务主要关注单张图像中的内容。然而,在处理视频时,我们需要获得超越单帧的信息。目标跟踪就可以用于实现这一点。
YOLO11 的目标跟踪能力可以在一系列视频帧中跟随特定物体(例如人或汽车)的移动。即使摄像头角度发生变化或出现其他物体,系统仍会持续跟踪同一个目标。
对于需要长期监测的应用来说,这一点至关重要,例如跟踪交通中的汽车。事实上,YOLO11 可以准确跟踪车辆,跟随每辆汽车以帮助实时估算其速度。因此,目标跟踪成为交通监控等系统的关键组成部分。

图 5。 YOLO11 对目标跟踪的支持可用于速度估算。
使用 YOLO11 检测有向边界框(OBB)#
现实世界中的物体并不总是完全对齐的——它们可能倾斜、侧向放置或处于奇怪的角度。例如,在卫星图像中,船只和建筑物通常会呈现旋转状态。
传统目标检测方法使用固定的矩形框,不会根据物体的方向进行调整,因此难以准确捕捉这些旋转形状。有向边界框(OBB)检测通过使用可旋转并紧密贴合物体的边界框解决了这一问题,使边界框与物体角度对齐,从而实现更精确的检测。
在港口监控方面,YOLO11 对 OBB 检测的支持可以帮助准确识别和跟踪不同方向的船只,确保每艘进出港口的船只都得到适当监控。这种精确检测能够实时提供船只的位置和运动信息,这对于管理繁忙港口和防止碰撞至关重要。

图 6。使用 OBB 检测和 YOLO11 检测船只。
姿态估计与 YOLO11:跟踪关键点#
姿态估计是一种计算机视觉技术,通过跟踪关节、四肢或其他标记等关键点来理解物体如何移动。该方法不是将整个物体或身体视为一个完整单元,而是将其分解为关键部分,从而能够详细分析动作、姿势和交互。
这项技术的一个常见应用是人体姿态估计。通过实时跟踪身体各部位的位置,它可以清晰呈现一个人的运动方式。这些信息可用于多种用途,从手势识别和活动监测到体育表现分析。
同样,在身体康复中,治疗师可以使用人体姿态估计和 YOLO11 监测患者在锻炼期间的动作。这有助于确保每个动作都正确完成,同时跟踪一段时间内的进展。

图 7。 YOLO11 可以使用姿态估计监测锻炼。
探索 YOLO11 如何支持各种计算机视觉任务#
现在我们已经详细了解了 YOLO11 支持的所有计算机视觉任务,接下来看看 YOLO11 是如何支持这些任务的。
YOLO11 不只是一个模型——它是一套专用模型变体,每个变体都针对特定的计算机视觉任务而设计。这使 YOLO11 成为一种能够适应广泛应用的灵活工具。你还可以在自定义数据集上对这些模型进行微调,以应对项目中的独特挑战。
以下是针对特定视觉任务进行预训练的 YOLO11 模型变体:
- YOLO11:该模型可以实时检测和标注多个物体,非常适合高速视觉识别。
- YOLO11-seg:该变体通过使用详细的掩膜将物体与背景分离,专注于分割任务。
- YOLO11-obb:该模型旨在通过绘制与每个物体方向对齐的边界框来检测旋转物体。
- YOLO11-cls:该变体根据图像的整体内容为其分配单个类别标签,从而完成图像分类。
- YOLO11-pose:该模型估计人体关键点,以跟踪姿势、四肢位置和运动。
每个变体都有不同的尺寸可供选择,用户可以根据具体需求在速度和准确率之间选择合适的平衡。
要点总结#
计算机视觉任务正在改变机器理解世界并与世界互动的方式。通过将图像和视频分解为关键元素,这些技术可以更轻松地详细分析物体、动作和交互。
从提升交通安全和体育表现,到简化工业流程,YOLO11 等模型都可以提供推动创新的实时洞察。随着视觉 AI 不断发展,它很可能会在我们日常解读和使用视觉数据的方式中发挥越来越重要的作用。
加入我们的社区,访问我们的 GitHub 仓库,了解 AI 的实际应用。浏览我们的许可选项,并在我们的解决方案页面上进一步了解农业中的 AI和制造业中的计算机视觉。









