探索计算机视觉的应用是如何运作的
与我们深入探讨计算机视觉的应用。我们还将详细讲解目标检测和分割等各种计算机视觉任务。

当我们在探讨计算机视觉模型的发展历史时,我们看到了计算机视觉是如何演变的,以及通往我们今天拥有的先进视觉模型的道路。像Ultralytics YOLOv8这样的现代模型支持多种计算机视觉任务,并正被用于各种令人兴奋的应用中。
在本文中,我们将深入了解计算机视觉和视觉模型的基础知识。我们将探讨它们的工作原理及其在各行各业中的多元化应用。计算机视觉创新无处不在,正在悄然改变我们的世界。让我们逐一揭开它们的奥秘!
什么是计算机视觉?#
人工智能 (AI) 是一个涵盖广泛技术的总称,旨在复制人类智慧的部分功能。计算机视觉正是人工智能的一个子领域。它专注于赋予机器“眼睛”,使其能够看见、观察并理解周围的环境。
就像人类视觉一样,计算机视觉解决方案旨在区分物体、计算距离并检测运动。然而,人类拥有终身的经验来帮助我们观察和理解世界,而计算机则依赖海量的数据、高分辨率摄像头和复杂的算法。

图 1. 人类视觉与计算机视觉的对比。
计算机视觉系统能够以惊人的速度和准确率处理和分析图像与视频等视觉数据。快速且精准地分析大量视觉信息的能力,使计算机视觉成为从制造业到医疗保健等各个行业中的强有力工具。
视觉模型支持多种计算机视觉任务#
计算机视觉模型是任何计算机视觉应用的核心。它们本质上是由深度学习技术驱动的计算算法,旨在赋予机器解释和理解视觉信息的能力。视觉模型支持从图像分类到目标检测等至关重要的计算机视觉任务。让我们更详细地了解其中一些任务及其具体用例。
图像分类#
图像分类涉及将图像分类并打上预定义的类别标签。像YOLOv8这样的视觉模型可以在标记图像的大型数据集上进行训练。在训练过程中,模型会学习识别与每个类别相关的模式和特征。一旦训练完成,它就能通过分析新图像的特征并将它们与所学习的模式进行比较,来预测未见过的图像的类别。

图 2. 图像分类示例。(来源:towardsdatascience.com)
图像分类有不同的类型。例如,在处理医学图像时,你可以使用二元分类将图片分为两组,如健康或生病。另一种类型是多类分类。它有助于将图像分类到许多组中,例如对农场中的不同动物进行分类(如猪、山羊和牛)。或者,假设你想将动物分为组和子组,比如先将动物分为哺乳动物和鸟类,然后再细分为狮子、老虎、老鹰和麻雀等物种,那么分层分类将是最佳选择。
目标检测#
目标检测是通过计算机视觉识别和定位图像及视频帧中物体的过程。它包含两个任务:目标定位(在物体周围绘制边界框)和目标分类(识别每个物体的类别)。基于边界框标注,视觉模型可以学习识别特定于每个物体类别的模式和特征,并预测新图像中这些物体的存在位置。
图 3. YOLOv8 目标检测被用于检测足球场上的球员。
目标检测在不同行业有着广泛的用例,从体育到海洋生物学无所不包。例如,在零售领域,Amazon’s Just Walk Out技术利用目标检测通过识别顾客拿取的商品来实现结账自动化。计算机视觉与传感器数据的结合,使顾客能够拿了商品就走,无需排队。
以下是其工作原理的详细说明:
- 安装在天花板上的摄像头捕捉顾客在店内走动的画面,这些视频片段由视觉模型进行实时处理。
- 目标检测用于检测顾客拿取并放入购物篮的确切产品,从而相应地更新他们的虚拟购物车。
- 货架上的重量传感器通过检测商品的移走或放回,进一步提高了准确性。
- 当顾客离开商店时,可以使用目标检测和面部识别技术来确认顾客已经离开,并且可以使用他们的支付详情(如信用卡)来进行自动扣款。
语义分割与实例分割#
语义分割和实例分割是帮助将图像划分为有意义片段的计算机视觉任务。语义分割根据像素的语义含义进行分类,并将同一类别内的所有对象视为具有相同标签的单一实体。它适用于标记无法计数的对象(如“天空”或“海洋”)或丛生的对象(如“树叶”或“草地”)。
另一方面,实例分割可以通过为每个检测到的物体分配唯一标签来区分同一类别的不同个体。你可以利用实例分割来对可数物体进行分割,即物体的数量和独立性非常重要时。它能够实现更精确的识别和区分。
图 4. 语义分割与实例分割示例。
通过一个与自动驾驶汽车相关的例子,我们可以更清楚地理解语义分割和实例分割之间的对比。语义分割非常适合需要理解场景内容的任务,可用于自动驾驶汽车中对道路上的特征(如人行横道和交通标志)进行分类。与此同时,实例分割可用于自动驾驶汽车中,以区分单个行人、车辆和障碍物。
姿态估计#
姿态估计是一项专注于检测和跟踪图像或视频中对象姿态关键点的计算机视觉任务。它最常用于人体姿态估计,关键点包括肩膀和膝盖等区域。估计人体的姿态有助于我们理解和识别对各种应用至关重要的动作和运动。

图 5. 使用 YOLOv8 进行姿态估计的示例。
姿态估计可用于体育领域以分析运动员的运动方式。NBA 使用姿态估计来研究球员在比赛中的移动和位置。通过跟踪肩膀、肘部、膝盖和脚踝等关键点,姿态估计为球员的运动提供了详细的见解。这些洞察有助于教练制定更好的策略、优化训练计划,并在比赛中进行实时调整。此外,这些数据还有助于监测球员的疲劳程度和受伤风险,从而提升球员的整体健康水平和表现。
旋转边界框目标检测#
旋转边界框目标检测(OBB)使用旋转矩形来精确识别和定位图像中的对象。与对齐图像坐标轴的标准边界框不同,OBB 会进行旋转以匹配对象的方向。这使得它们对于并非完全水平或垂直的对象特别有用。它们擅长精准定位和隔离旋转对象,以防止在拥挤的环境中发生重叠。
图 6. 使用 YOLOv8 在船只航拍图像上进行旋转边界框检测的示例。
在海事监视中,识别和跟踪船只是确保安全和资源管理的关键。OBB 检测可用于船只的精确定位,即使它们密集排列或以各种角度定向时也是如此。它有助于监测航道、管理海上交通并优化港口运营。在飓风或漏油等事件发生后,它还可以通过快速识别和评估对船只和基础设施的损坏来协助灾害响应。
目标跟踪#
到目前为止,我们已经讨论了处理图像的计算机视觉任务。对象跟踪是一项能够在视频帧中跟踪对象的计算机视觉任务。它首先通过检测算法在第一帧中识别对象,然后在对象在视频中移动时持续跟踪其位置。对象跟踪涉及对象检测、特征提取和运动预测等技术,以保持跟踪的准确性。

图 7. 使用 YOLOv8 跟踪鱼类。
诸如 YOLOv8 之类的视觉模型可用于在海洋生物学中跟踪鱼类。研究人员利用水下摄像机,可以监测鱼类在其自然栖息地中的运动和行为。该过程从在最初几帧中检测单个鱼类开始,然后贯穿整个视频跟踪它们的位置。跟踪鱼类有助于科学家了解迁徙模式、社会行为以及与环境的互动。它还通过深入了解鱼类的分布和丰度,为可持续捕捞实践提供支持。
计算机视觉的终极展望#
计算机视觉正在积极改变我们使用技术和与世界互动的方式。通过利用深度学习模型和复杂算法来理解图像和视频,计算机视觉正在帮助各行各业简化诸多流程。诸如目标检测和目标跟踪之类的计算机视觉任务,使得创建前所未有的解决方案成为可能。随着计算机视觉技术的不断进步,未来将涌现出更多创新的应用!
让我们一起学习,共同成长!探索我们的 GitHub 仓库以查看我们对 AI 的贡献。了解我们如何通过 AI 重新定义自动驾驶汽车和农业等行业。🚀






