使用 Ultralytics YOLO26 和视觉 AI 构建智能产品
了解如何使用 YOLO26 和视觉 AI 构建智能产品,实现实时检测、智能自动化以及可扩展且响应迅速的产品体验。

每天,嵌入设备、机器和公共基础设施中的摄像头都会采集数千小时的视频。其中大部分视频只有在出现问题时才会被存储、快速浏览或查看。
很多时候,视觉数据是可用的,但实时解读这些数据的能力却不足。随着产品变得更加互联和数据驱动,这一限制正变得越来越明显。
用户希望系统不只是记录事件或执行固定指令。例如,他们希望智能产品能够识别正在发生的事情并立即做出响应,而不必等待人工审核或依赖僵化的规则集。
人工智能领域的最新进展正在帮助弥合这一差距。尤其是,计算机视觉使机器能够解读图像和视频,让系统分析场景并实时做出响应。
不过,要将这一能力引入产品,需要兼具速度和可靠性的模型。像 Ultralytics YOLO26 这样的先进计算机视觉模型正是为此而构建,能够提供实时部署所需的速度和准确率。
Ultralytics YOLO26 支持目标检测、实例分割和目标跟踪等核心视觉任务,使产品能够解读视觉数据并做出智能响应。

图 1. 使用 YOLO26 检测图像中的目标(来源)
本文将探讨如何利用计算机视觉和 Ultralytics YOLO26 构建更智能的产品,并支持现实应用中的智能自动化。让我们开始吧!
传统产品开发的不足#
在深入了解计算机视觉如何帮助构建更智能的产品之前,我们先仔细看看团队依赖传统的基于规则的系统和较旧算法时所面临的挑战。
以下是传统产品开发面临的一些主要挑战:
- **僵化的基于规则的系统:**硬编码逻辑在受控环境中可能有效,但现实环境很少是可预测的。光照、摄像头角度或目标外观的细微变化,都可能迅速破坏预定义规则并降低准确率。
- **对现实世界变化的适应性较差:**传统系统无法很好地适应新的或意外的场景。更新通常需要人工调参和反复优化,这会减缓产品改进速度并增加维护工作量。
- **可扩展性限制:**随着图像和视频数据量增长,较旧的图像处理流水线难以跟上。处理速度会变慢,使视频流难以维持实时性能。
- **实时场景中的高延迟:**许多传统方法无法足够快速地处理连续视觉流。输出延迟会削弱自动化能力并降低整体响应速度。
- **高昂的计算需求:**要达到可接受的准确率,通常需要大量硬件资源,包括专用图形处理单元(GPUs),从而增加基础设施成本。
计算机视觉在构建更智能产品中的作用#
接下来,让我们看看计算机视觉如何支持更智能的产品行为。
如今,大多数互联产品已经在日常运营流程中收集视觉数据。摄像头被集成到各种设备中,安装在实体空间内,并通过物联网(IoT)系统连接起来。
因此,图像和视频一直在后台持续采集。挑战并不在于收集这些数据。
真正棘手的部分是实时理解所收集的数据。如果没有视觉智能,视频资料只会被存储起来,之后再进行查看,而那时问题往往已经发生。
计算机视觉改变了这一点。通过使用经过模式识别训练的神经网络,系统可以实时分析图像和视频。产品不再依赖固定规则或人工检查,而是能够解读场景中正在发生的事情,并在事件发生时做出响应。
为了将这种视觉能力引入产品,团队可以依靠高效的计算机视觉模型,例如 Ultralytics YOLO26。YOLO26 支持关键视觉任务,能够帮助产品快速解读视觉信息,从而实现实时决策。
视觉驱动型产品的构成要素#
下面简要介绍计算机视觉任务如何帮助打造更智能的产品:
- **目标检测:**该任务可以使用边界框识别并定位每一帧中的相关目标,同时分配置信度分数,从而清晰了解图像中存在的内容。
- **目标跟踪:**它可以用于在多个帧中跟踪特定目标,让视觉系统理解目标随时间发生的运动和变化。
- **图像分类:**该任务根据图像的主要内容为整张图像分配标签,对场景进行分类或识别帧中的特定情况。
- **实例分割:**它可以在像素级精确勾勒目标轮廓,帮助产品更好地理解形状、边界和空间关系。
- **姿态估计:**该任务可以检测人体或其他可活动目标上的关键点,实时捕捉姿态、动作和物理交互。
- **定向边界框(OBB)检测:**它可以使用旋转边界框而不是标准水平边界框来检测目标。当目标倾斜出现或处于紧密排列的环境中时,这能够提高定位准确率。
当这些能力应用于连续视觉数据时,产品可以更快地响应、更可靠地实现自动化,并提供让人感觉具备感知能力而非仅被动响应的体验。系统不必等待事后查看事件,而是能够即时理解并采取行动。
实时视觉模型如何实现智能产品行为#
随着你进一步了解视觉驱动型产品,你可能会想知道,系统如何从单纯录制视频转变为真正实时响应。
这一过程始于识别摄像头前方的内容。随着视频流输入,视觉模型会分析每一帧并识别重要元素,例如特定目标或人员。系统不会对每个动作都做出反应,而是只关注相关信号。
速度是另一个关键方面。实时系统必须快速且稳定地处理每一帧,确保检测和决策不会出现明显延迟。
例如,Ultralytics YOLO(只看一次)系列模型就是为实时处理视觉数据而构建的。Ultralytics YOLO26 在 Ultralytics YOLOv5、Ultralytics YOLOv8 和 Ultralytics YOLO11 等早期版本的基础上进行了改进,融入了架构优化、性能优化和效率提升。最终,即使在要求严苛的现实条件下,也能实现更高的速度和准确率。
集成到产品后,这些模型会在后台持续运行,分析到达的每一帧。系统会检查预定义条件,一旦条件满足,就能立即触发警报、更新工作流或启动操作。
这使视觉驱动型系统更具响应性、更易扩展,也更适合整合到从机器人和自动驾驶汽车到智能家居及安防系统等各种环境中。对企业领导者而言,这意味着更快的响应、更少的人工检查,以及感觉可靠而非被动的自动化。
使用 Ultralytics YOLO26 为产品提供实时视觉智能#
Ultralytics YOLO 模型(包括 YOLO26)以预训练模型的形式开箱即用。这意味着它们已经在 COCO 等大型且广泛使用的数据集上完成训练。
得益于预训练,Ultralytics YOLO26 可以立即识别现实世界中常见的目标。这为产品团队提供了实用的起点,使他们无需从头训练模型就能构建视觉功能。
针对更具体的产品需求,还可以使用带有高质量标注的领域专用数据,对这些预训练模型进行进一步微调。
例如,考虑一家配备天花板摄像头的餐厅。像 Ultralytics YOLO26 这样的定制训练视觉 AI 模型可以检测店内有多少人,还能识别哪些餐桌有人使用、哪些椅子空着。

图 2. Ultralytics YOLO26 支持在零售店中实时检测人员、开放空间和有店员值守的收银台。(来源)
在这类场景中,Ultralytics YOLO26 充当持续在后台运行的视觉引擎。团队还可以根据性能需求和能效目标,将此类模型部署到边缘设备上。
YOLO 模型在智能产品中的现实应用#
现在我们已经更好地了解了实时视觉模型的工作方式,接下来看看 Ultralytics YOLO 模型如何应用于智能产品中的不同用例,让产品更具感知能力、响应更迅速,并能够根据所看到的内容采取行动。
借助 YOLO 实现医疗产品智能化#
在医疗领域的手术培训中,人们通常需要人工查看数小时的手术过程视频,以评估器械操作和工作流程。这一过程耗时较长,而且高度依赖人工观察。
将基于 YOLO 的视觉模型集成到系统后,系统可以在手术进行时自动分析视频流。模型能够实时检测手术器械,并识别其使用的位置和时间。
这使结构化记录、更完善的分析和高质量的表现洞察成为可能,无需持续进行人工审核。事实上,一项使用 Ultralytics YOLO11 模型的研究表明,实时腹腔镜器械检测即使在嵌入式系统上也能有效运行;该模型是最新 YOLO26 模型的前代版本。

图 3. 使用 YOLO 实时检测腹腔镜器械(来源)
该模型在保持高准确率的同时,运行速度足以满足实时手术环境的需求。这说明深度学习如何在手术过程中支持可靠的实时视觉反馈。
打造由 YOLO 驱动的智能零售体验#
我们都曾站在拥挤的超市货架前,努力寻找合适的商品。许多商品外观相似,标签很小,而且商品经常被放错位置。
对零售商而言,这使实时了解货架情况变得困难。视觉 AI 和 YOLO 目标检测模型可以通过摄像头画面和实时视频流,帮助店内系统了解货架上实际摆放的商品。这减少了对条形码扫描和人工检查的依赖,使货架监控更加准确且响应更及时。

图 4. 使用 Ultralytics YOLO26 检测和分割超市货架上的商品
有了这种准确性,零售商不再需要仅依赖定期人工检查。货架可以通过实时视频持续监控。
库存不足可以立即被标记,摆放错误的商品能够更快被发现,结账流程也能更加顺畅。这让零售商获得更好的运营控制,同时为顾客带来更加顺畅的购物体验。
视觉 AI 与自主导航#
自主系统可以非常高效,但通常依赖固定路线或预设坐标。这在稳定环境中可行,但现实条件很少始终不变。
由深度学习模型驱动的视觉 AI 解决方案能够让机器理解周围环境并实时进行调整。将计算机视觉与自适应算法结合后,系统可以随着变化发生进行响应,而不必依赖僵化的预编程指令。
那么,这在现实环境中是如何实现的?以一台在仓库中运行的机器人为例。摄像头持续捕捉周围环境,视觉模型执行实时目标检测,以识别障碍物、货架和通道。
这些检测结果支持定位,帮助机器人确定其在设施内的精确位置。基于这些视觉输入,优化算法会立即调整路线,使机器人能够高效导航,即使环境发生变化也能保持自动化流程顺畅运行。
基础设施监控与更智能的缺陷检测#
电力线路和电网设备需要定期检查,以确保安全可靠。大多数情况下,这些公用设施检查仍然需要人工完成,在大范围或偏远地区开展时既耗时又难以管理。
视觉 AI 提供了一种更简单的基础设施监控方式,不必完全依赖按计划进行的现场巡查。像 Ultralytics YOLO26 这样的模型可以直接从真实户外条件下采集的图像中检测电力线路绝缘子上的缺陷,包括裂纹、腐蚀或明显损坏。
通过实时分析视觉数据,此类系统可以标记原本可能被忽视的潜在问题。及早发现这些问题能够降低设备故障风险、减少意外停电,并支持更加主动的维护运营。
衡量基于视觉的智能产品的 ROI#
对企业领导者而言,视觉 AI 不只是技术性能的问题,更关乎可衡量的业务影响。
经过周密实施后,视觉驱动型系统可以提高效率、降低成本并提升准确率。这些提升还有助于改善用户体验和整体表现。
以下是一些能够清晰体现这种影响的领域:
- **减少人工投入:**视觉系统能够自动执行重复性的检查、监控和验证任务,降低对人工流程的依赖,让团队可以专注于更具战略性的工作。
- **缩短决策周期:**实时视觉分析能够让系统立即检测问题或触发操作,缩短响应时间并保持运营顺畅。
- **减少运营错误:**自动化检测带来一致性。通过减少日常任务中的人工监督,组织通常可以减少错误并获得更可靠的结果。
- **提升用户参与度:**能够进行智能视觉感知和响应的产品会让人感觉更具互动性和相关性。这将带来更强的用户信任、更好的体验和更高的长期采用率。
要点总结#
视觉 AI 使产品能够实时解读视觉信息,支持更智能的自动化和响应更迅速的体验。借助检测、跟踪和分割等能力,系统可以超越基础规则,实现上下文感知决策。Ultralytics YOLO26 等高效模型让构建可扩展且具有竞争力的视觉驱动型产品变得切实可行。
加入我们的活跃社区,探索人工智能在制造业中的应用和零售领域的视觉 AI等创新。访问我们的 GitHub 代码仓库,查看我们的许可选项,立即开始计算机视觉之旅。






