你需要了解的 2025 年计算机视觉全部知识
了解计算机视觉如何通过目标检测、图像分类和姿态估计等 AI 驱动任务改变各个行业。

二十年前,机器和计算机能够看见并理解世界这一想法还只是科幻小说中的情节。如今,得益于人工智能(AI)的进步,这一概念已经成为现实。尤其是作为 AI 分支的计算机视觉(CV),能够让机器理解和分析图像与视频。无论是实时识别物体、改进安防系统,还是自动化复杂任务,其潜力都在不断突破可能性的边界。
随着各行各业探索采用计算机视觉独特能力的不同方式,计算机视觉正在快速塑造技术的未来。全球计算机视觉技术市场规模在 2024 年达到 198.3 亿美元,预计未来几年将以每年 19.8% 的速度增长。

图 1。全球计算机视觉市场规模。
本文将深入了解计算机视觉,包括它是什么、如何演变,以及如今如何运作。我们还将探讨其中一些最有趣的应用。现在开始吧!
什么是计算机视觉?#
计算机视觉是 AI 的一个子领域,它利用机器学习和神经网络教会计算机理解图像或视频文件等视觉数据的内容。通过处理图像获得的洞察可用于做出更好的决策。例如,在零售业中,计算机视觉可以通过分析货架图像来跟踪库存水平,或借助自动结账系统改善购物体验。许多企业已经将计算机视觉技术用于各种应用,从为智能手机照片添加滤镜,到制造业质量控制等任务。
你可能会问:为什么如此需要计算机视觉解决方案?发现缺陷或识别模式等需要持续注意力的任务对人类来说可能很困难。眼睛会疲劳,细节也可能被忽略,尤其是在节奏快或环境复杂的情况下。
人们擅长识别不同大小、颜色、光照或角度下的物体,但在压力下往往难以保持一致性。相比之下,计算机视觉解决方案可以不停工作,快速而准确地处理大量视觉数据。例如,它可以实时分析交通状况,检测拥堵、优化信号灯时序,甚至比人类观察者更快地识别事故。
了解计算机视觉的历史#
多年来,计算机视觉已经从理论概念发展为推动各行业创新的可靠技术。下面来看看定义其发展的几个重要里程碑:
-
**20 世纪 50 年代至 60 年代:**研究人员开始开发处理和分析视觉数据的算法,但由于计算能力有限,进展缓慢。
-
**20 世纪 70 年代:**这一时期算法取得了重大改进,例如霍夫变换,它提升了图像中直线和几何形状的检测能力。光学字符识别(OCR)也在这一时期出现,使机器能够读取印刷文本。
-
**20 世纪 80 年代至 90 年代:**机器学习开始在计算机视觉中发挥作用,为更先进的能力和未来的突破铺平了道路。
-
**21 世纪 00 年代至 10 年代:**深度学习为计算机视觉带来了新的维度,使机器能够更有效地解读视觉数据。它增强了物体识别、运动分析和复杂任务执行等能力。
如今,计算机视觉正在快速发展,改变我们在医疗保健、自动驾驶汽车和智慧城市等领域解决问题的方式。为实时计算机视觉任务而设计的 Ultralytics YOLO(You Only Look Once)模型,让各行各业能够更轻松、高效且准确地实现视觉 AI。随着 AI 和硬件持续改进,这些模型通过先进的视觉数据分析帮助企业做出更明智的决策并简化运营。
解析计算机视觉的工作原理#
计算机视觉系统使用神经网络分析图像。神经网络是受人脑工作方式启发的算法。其中一种特定类型称为卷积神经网络(CNN),尤其擅长识别图像中的边缘和形状等模式。
为了简化视觉数据,池化等技术会聚焦于图像中最重要的部分,而其他层则处理这些信息,以执行识别特征或检测物体等任务。像为速度和准确性而设计的 Ultralytics YOLO11 这样的先进模型,使实时图像处理成为可能。

图 2。使用 Ultralytics YOLO11 进行物体检测的示例。
典型的计算机视觉应用包含多个步骤,用于将原始图像转换为有用的洞察。以下是四个主要阶段:
-
图像采集:使用摄像头或传感器收集视觉数据,图像质量取决于所用传感器的类型。
-
图像处理:随后通过降噪和突出边缘等预处理技术增强所收集的数据,使其更易于分析。
-
特征提取:提取形状和纹理等重要细节,聚焦于图像中最关键的部分。
-
模式识别:使用机器学习分析已识别的特征,以完成检测物体、跟踪运动或识别模式等任务。
探索计算机视觉任务#
你可能已经注意到,在讨论计算机视觉的工作原理时,我们提到了计算机视觉任务。Ultralytics YOLO11 等模型旨在支持这些任务,为实际应用提供快速而准确的解决方案。从检测物体到跟踪物体运动,YOLO11 都能高效处理这些任务。下面来探索它支持的一些关键计算机视觉任务及其工作方式。
目标检测#
物体检测是计算机视觉的一项关键任务,用于识别图像中感兴趣的物体。物体检测任务的输出是一组边界框(围绕图像中检测到的物体绘制的矩形),以及类别标签(每个物体的类别或类型,例如“汽车”或“人”)和置信度分数(表示模型对每次检测结果确信程度的数值)。例如,物体检测可用于识别并确定街道上行人或交通中汽车的位置。

图 3。使用 Ultralytics YOLO11 进行物体检测。
图像分类#
图像分类的主要目标是根据输入图像的整体内容,为其分配预定义的标签或类别。这项任务通常涉及识别图像中的主要物体或特征。例如,图像分类可用于判断图像中包含的是猫还是狗。如下面所示,YOLO11 等计算机视觉模型甚至可以通过自定义训练来分类猫或狗的具体品种。

图 4。使用 YOLO11 对不同猫品种进行分类。
实例分割#
实例分割是另一项重要的计算机视觉任务,广泛应用于各种场景。它会将图像分割成多个区域,并识别每个独立物体,即使图像中存在多个相同类型的物体。与物体检测不同,实例分割还会进一步勾勒出每个物体的精确边界。例如,在汽车制造和维修中,实例分割可以帮助分别识别和标注每个汽车零部件,使流程更加准确高效。

图 5。使用 YOLO11 进行汽车零部件分割。
姿态估计#
姿态估计旨在通过预测手、头部和肘部等关键点的位置,确定人物或物体的位置和方向。这在需要实时理解身体动作的应用中尤其有用。人体姿态估计常用于体育分析、动物行为监测和机器人等领域。

图 6。 YOLO11 可帮助进行人体姿态估计。
如需了解 YOLO11 支持的其他计算机视觉任务,可以参考 Ultralytics 官方文档。其中详细介绍了 YOLO11 如何处理物体跟踪和定向边界框(OBB)物体检测等任务。
如今热门的计算机视觉模型#
尽管计算机视觉模型众多,Ultralytics YOLO 系列仍凭借出色的性能和通用性脱颖而出。随着时间推移,Ultralytics YOLO 模型不断改进,速度更快、准确性更高,并且能够处理更多任务。Ultralytics YOLOv5 发布后,借助 PyTorch 等视觉 AI 框架,模型部署变得更加容易。它让更多用户能够使用先进的视觉 AI,同时兼具高准确率和易用性。
随后,Ultralytics YOLOv8 通过加入实例分割、姿态估计和图像分类等新能力进一步提升了性能。与此同时,最新版本 YOLO11 在多项计算机视觉任务中实现了顶尖性能。YOLO11m 的参数量比 YOLOv8m 少 22%,却在 COCO 数据集上取得更高的平均精度均值(mAP),这意味着它能够更精准、高效地检测物体。无论你是经验丰富的开发者,还是刚接触 AI 的新手,YOLO11 都能为你的计算机视觉需求提供强大的解决方案。
计算机视觉在日常生活中的作用#
前面我们讨论了 Ultralytics YOLO11 等计算机视觉模型如何应用于众多行业。现在,让我们探索更多正在改变日常生活的应用场景。
医疗保健领域的视觉 AI#
医疗保健领域的计算机视觉拥有广泛的应用场景。物体检测和分类等任务被用于医学影像分析,以更快、更准确地检测疾病。在 X 射线分析中,计算机视觉能够识别人眼可能难以察觉的模式。
它还用于癌症检测,通过比较癌细胞与健康细胞来进行分析。同样,在 CT 扫描和 MRI 方面,计算机视觉可以以接近人类的准确度分析图像。它能帮助医生做出更好的决策,并最终挽救更多生命。

图 7。使用 YOLO11 分析医学扫描图像。
汽车行业中的 AI#
计算机视觉对自动驾驶汽车至关重要,能够帮助汽车检测道路标志和交通信号灯等物体。诸如光学字符识别(OCR)等技术可以让汽车读取道路标志上的文字。它还用于行人检测,通过物体检测任务实时识别人。
此外,计算机视觉甚至可以发现路面裂缝和坑洼,从而更好地监测不断变化的道路状况。总体而言,计算机视觉技术能够在改善交通管理、提升交通安全和支持智慧城市规划方面发挥关键作用。

图 8。使用 YOLO11 了解交通状况。
农业中的计算机视觉#
假设农民能够自动按时播种、浇水和收获作物,不必为此担忧。这正是计算机视觉为农业带来的改变。它支持实时作物监测,让农民能够比人类更准确地发现疾病或营养缺乏等问题。
除了监测之外,集成计算机视觉的 AI 驱动自动除草机还能够识别并清除杂草,降低劳动力成本并提高作物产量。这种技术组合帮助农民优化资源、提升效率并保护作物。

图 9。在农业中使用 Ultralytics YOLO11 的示例。
使用 AI 实现制造流程自动化#
在制造业中,计算机视觉可以帮助自动监控生产、检查产品质量并跟踪工人。视觉 AI能够让流程更快速、更准确,同时减少错误并降低成本。
具体而言,质量保证通常会使用物体检测和实例分割。缺陷检测系统会对成品进行最终检查,确保只有最优质的产品交付给客户。任何存在凹痕或裂缝的产品都会被自动识别并剔除。这些系统还会实时跟踪和计数产品,持续监控装配线。

图 10。使用计算机视觉监控装配线。
借助计算机视觉提升教育效果#
计算机视觉应用于课堂的一种方式是手势识别——通过检测学生的动作实现个性化学习。Ultralytics YOLO11 等模型非常适合这项任务,能够准确识别举手或困惑表情等手势,并实现实时处理。
检测到这些手势后,系统可以通过提供额外帮助或调整内容来适应当前课程,使其更符合学生的需求。这将营造更加动态、自适应的学习环境,帮助教师专注于教学,同时由系统支持每位学生的学习体验。
计算机视觉的最新趋势#
现在我们已经了解了计算机视觉在各行业的一些应用,下面深入探讨推动其发展的关键趋势。
其中一个主要趋势是边缘计算,这是一种在更接近数据源的位置处理数据的分布式计算框架。例如,边缘计算能够让摄像头和传感器等设备直接处理视觉数据,从而缩短响应时间、减少延迟并提升隐私保护能力。
计算机视觉的另一个关键趋势是混合现实的应用。它将物理世界与数字元素结合起来,利用计算机视觉让虚拟物体与现实世界自然融合。它可用于改善游戏、教育和培训体验。
计算机视觉的优点与缺点#
以下是计算机视觉能够为各行业带来的一些主要优势:
-
**节省成本:**使用计算机视觉自动化任务有助于降低运营成本、提高生产力并减少错误。
-
**可扩展性:**计算机视觉系统部署后,可以轻松扩展以处理大量数据,因此适合不断发展的企业或大规模运营。
-
**面向应用的定制:**你可以使用自己的数据集对计算机视觉模型进行微调,从而获得高度专业化、符合应用需求的解决方案。
虽然这些优势体现了计算机视觉对各行业的影响,但同样需要考虑实施过程中涉及的挑战。以下是一些主要挑战:
-
**数据隐私问题:**视觉数据的使用,尤其是在监控或医疗保健等敏感领域,可能引发隐私和安全问题。
-
**环境限制:**在光照不足、图像质量低或背景复杂等具有挑战性的环境中,计算机视觉系统可能难以正常运行。
-
**初始成本较高:**由于需要专业硬件、软件和专业知识,开发和实施计算机视觉系统可能成本高昂。
要点总结#
计算机视觉让机器能够像人类一样看见并理解世界,正在重新定义机器与世界互动的方式。它已经应用于许多领域,例如提升自动驾驶汽车的安全性、帮助医生更快诊断疾病、让购物体验更加个性化,甚至协助农民监测作物。
随着技术不断进步,边缘计算和混合现实等新趋势正在带来更多可能性。尽管仍存在偏见和高成本等挑战,计算机视觉未来仍有潜力对许多行业产生巨大的积极影响。
如需了解更多信息,请访问我们的 GitHub 代码仓库并参与我们的社区交流。你还可以在我们的解决方案页面探索自动驾驶汽车中的 AI和农业中的计算机视觉等领域的创新。🚀









