探索计算机视觉应用的工作原理
和我们一起深入了解计算机视觉的应用。我们还将介绍目标检测和分割等各种计算机视觉任务。

在探索计算机视觉模型的历史时,我们了解了计算机视觉的发展历程,以及通往如今先进视觉模型的道路。现代模型(如Ultralytics YOLOv8)支持多种计算机视觉任务,并已应用于各种令人振奋的领域。
本文将介绍计算机视觉和视觉模型的基础知识,涵盖它们的工作原理以及在各行各业中的多样化应用。计算机视觉创新无处不在,默默地塑造着我们的世界。让我们逐一揭开它们的面纱!
什么是计算机视觉?#
人工智能(AI)是一个涵盖众多技术的总称,这些技术旨在复制人类智能的某些部分。计算机视觉就是人工智能的一个子领域。计算机视觉致力于赋予机器能够看见、观察并理解周围环境的“眼睛”。
与人类视觉类似,计算机视觉解决方案旨在区分物体、计算距离并检测运动。然而,人类依靠一生积累的经验来观察和理解世界,而计算机则依赖海量数据、高清摄像头和复杂算法。

图 1. 人类视觉与计算机视觉对比。
计算机视觉系统能够以惊人的速度和准确度处理并分析图像、视频等视觉数据。快速、准确地分析海量视觉信息的能力,使计算机视觉成为从制造业到医疗保健等各个行业中的强大工具。
视觉模型支持各种计算机视觉任务#
计算机视觉模型是任何计算机视觉应用的核心。它们本质上是由深度学习技术驱动的计算算法,旨在赋予机器解读和理解视觉信息的能力。视觉模型支持从图像分类到目标检测等关键计算机视觉任务。下面让我们更详细地了解其中一些任务及其使用场景。
图像分类#
图像分类是指将图像归入预先定义的类别或分类中并进行标注。像YOLOv8这样的视觉模型可以使用大量带标注图像的数据集进行训练。在训练过程中,模型会学习与每个类别相关的模式和特征。训练完成后,模型可以通过分析新图像的特征,并将其与已学习的模式进行比较,预测未见过的新图像所属的类别。

图 2. 图像分类示例。(来源:towardsdatascience.com)
图像分类有不同的类型。例如,在处理医学图像时,你可以使用二分类将图片分为两组,例如健康或患病。另一种类型是多分类,它可以将图像分为多个组,例如对农场中的不同动物进行分类,包括猪、山羊和牛。或者,假设你想将动物分为组和子组,例如先将动物分为哺乳动物和鸟类,再进一步分为狮子、老虎、鹰和麻雀等物种;这时层次分类会是最佳选择。
目标检测#
目标检测是使用计算机视觉识别并定位图像和视频帧中物体的过程。它包含两个任务:目标定位,即在物体周围绘制边界框;目标分类,即识别每个物体所属的类别。基于边界框标注,视觉模型可以学习识别每个物体类别特有的模式和特征,并预测这些物体在新的、未见过的图像中的存在及位置。
图 3. 使用 YOLOv8 在足球场上检测球员的目标检测。
目标检测在各行各业都有许多应用场景,从体育到海洋生物学均有涉及。例如,在零售业中,Amazon 的 Just Walk Out技术通过识别顾客拿取的商品,使用目标检测实现自动结账。计算机视觉与传感器数据相结合,让顾客可以拿上商品直接离开,无需排队等待。
下面来详细了解它的工作原理:
- 安装在天花板上的摄像头会捕捉顾客在商店内移动的画面,视觉模型会实时处理这些视频素材。
- 目标检测用于检测顾客拿起并放入购物篮的具体商品,并据此更新其虚拟购物车。
- 货架上的重量传感器可以通过检测商品被取走或放回,进一步提高准确性。
- 当顾客离开商店时,可以使用目标检测和人脸识别技术确认顾客已经离开,然后使用其支付信息(如信用卡)自动完成扣款。
语义分割与实例分割#
语义分割和实例分割是帮助将图像划分为有意义区域的计算机视觉任务。语义分割根据像素的语义含义进行分类,并将同一类别中的所有物体视为具有相同标签的单个实体。它适合标注“天空”或“海洋”等不可数对象,或“树叶”或“草”等集合区域。
另一方面,实例分割可以通过为每个检测到的物体分配唯一标签,区分同一类别中的不同实例。你可以使用实例分割来分割数量和独立性都很重要的可数对象。它能够实现更精确的识别和区分。
图 4. 语义分割与实例分割示例。
通过一个与自动驾驶汽车相关的示例,我们可以更清楚地理解语义分割与实例分割之间的差异。语义分割非常适合需要理解场景内容的任务,可用于自动驾驶汽车中,对道路上的特征进行分类,例如人行横道和交通标志。与此同时,实例分割可用于自动驾驶汽车,区分单个行人、车辆和障碍物。
姿态估计#
姿态估计是一项计算机视觉任务,专注于检测和跟踪图像或视频中物体姿态的关键点。它最常用于人体姿态估计,关键点包括肩膀和膝盖等部位。估计人体姿态有助于我们理解和识别对各种应用至关重要的动作和运动。

图 5. 使用 YOLOv8 进行姿态估计的示例。
姿态估计可用于体育运动,分析运动员的移动方式。NBA 使用姿态估计研究比赛期间球员的移动和位置。通过跟踪肩膀、肘部、膝盖和脚踝等关键点,姿态估计可以深入分析球员的动作。这些洞察有助于教练制定更好的策略、优化训练计划,并在比赛期间进行实时调整。此外,这些数据还可以帮助监测球员的疲劳程度和受伤风险,从而改善球员的整体健康状况和表现。
定向边界框目标检测#
定向边界框目标检测(OBB)使用旋转矩形来精确识别和定位图像中的物体。与沿图像轴对齐的标准边界框不同,OBB 会旋转以匹配物体的方向。这使其特别适合不完全水平或垂直的物体。它们能够准确定位并隔离旋转物体,防止在拥挤环境中发生重叠。
图 6. 使用 YOLOv8 在船只航拍图像上进行定向边界框检测示例。
在海事监控中,识别和跟踪船只对于安全与资源管理至关重要。即使船只排列密集或方向各异,也可以使用 OBB 检测对其进行精确定位。它有助于监控航道、管理海上交通并优化港口运营。此外,在飓风或石油泄漏等事件发生后,它还可以通过快速识别和评估船只及基础设施的损坏情况,协助灾害响应。
目标跟踪#
到目前为止,我们讨论的计算机视觉任务都处理图像。目标跟踪是一项可以在视频各帧中持续跟踪物体的计算机视觉任务。它首先使用检测算法在第一帧中识别物体,然后持续跟随物体在视频中的移动位置。目标跟踪涉及目标检测、特征提取和运动预测等技术,以保持跟踪的准确性。

图 7. 使用 YOLOv8 跟踪鱼类。
像 YOLOv8 这样的视觉模型可用于在海洋生物学中跟踪鱼类。研究人员可以使用水下摄像头监测自然栖息地中鱼类的移动和行为。该过程首先在前几帧中检测单条鱼,然后持续跟踪它们在视频中的位置。跟踪鱼类有助于科学家了解迁徙模式、社会行为以及它们与环境之间的互动。此外,它还可以通过提供鱼类分布和数量方面的洞察,支持可持续捕捞实践。
最后了解一下计算机视觉#
计算机视觉正在积极改变我们使用技术以及与世界互动的方式。通过使用深度学习模型和复杂算法理解图像与视频,计算机视觉帮助各行业简化众多流程。目标检测和目标跟踪等计算机视觉任务,让我们能够创建以往难以想象的解决方案。随着计算机视觉技术不断进步,未来还将出现更多创新应用!
让我们一起学习和成长!探索我们的 GitHub repository,了解我们对 AI 的贡献。看看我们如何借助 AI 重新定义自动驾驶汽车和农业等行业。🚀









