YOLO Vision 2026:
指南

如何将 AI 分析添加到现有安全相机中

向现有相机资产添加 AI 分析的三种途径:分析层、VMS 升级和自托管模型,以及决定选择的制约因素。

MIMiles Deans14 min read
如何将 AI 分析添加到现有安全相机中

几乎每个在询问如何为安全摄像头添加AI的组织,其所需答案都已包含在以下三种选择中,而常见的错误是从软件入手,而不是从现有设备入手。你拥有的摄像头(它们在关键距离上的分辨率、角度、低光照表现以及其视频流的处理位置)决定了你究竟能采用这三种路线中的哪一种。

本指南首先涵盖了必不可少的真实摄像头审计,接着介绍了三条路线:购买一个覆盖现有视频管理系统的分析层、升级VMS或摄像头本身、以及在你现有的视频流上自托管检测模型。大多数读者应选择前两种之一。第三种路线适用于特定的一组限制条件,本指南将明确指出具体情况。

从设备入手,而不是从软件入手#

分析供应商会乐意连接到一个根本无法支持你所需检测的摄像头。在评估之前,请先进行审计。

  • 目标上的像素,而不是百万像素。 覆盖开阔庭院的4K摄像头在四十米处捕捉到的人体像素,可能比覆盖门廊的1080p摄像头还要少。每种检测都有一个最低像素高度,这是改造效果不达预期最常见的原因。
  • 角度。 为安防而安防的摄像头通常采用特定角度,以便在宽广区域内看到人脸。对于计数和区域逻辑而言,这是最差的几何视角之一,而俯视视角的效果远胜于斜视视角。
  • 低光照和逆光表现。 请在黄昏、夜晚以及阳光直射镜头的任何时段进行测试。红外照明会显著改变图像特征,仅在日光画面下评估的模型会让你感到意外。
  • 帧率和编解码器。 高度压缩的低帧率视频流会丢失模型所依赖的细节。请检查录像机实际存储的内容与摄像头能输出的内容之间的差异。
  • 视频流访问。 你能否在不降低录像质量的情况下,为每个摄像头获取第二个RTSP流?许多摄像头支持较低分辨率的子码流,这通常已经足够且处理成本低得多。
  • 网络容量和拓扑。 对许多视频流进行持续分析,要么会消耗传输至中央服务器的带宽,要么需要在摄像头附近进行计算。这一点比软件偏好更能决定架构的选择。
  • 摄像头年龄和补丁状态。 在扁平网络中使用默认凭据的摄像头,在成为分析机遇之前,首先是一个安全问题。

此次审计的产出通常是一个分类结果:部分摄像头适合区域和存在检测,少数摄像头足以支持精细分类,还有少数摄像头无论选择哪条路线都需要重新定位或更换。

三条路线#

路线你添加的内容最适合于工作量主要限制
现有VMS之上的分析层消费你现有视频流的供应商产品你希望快速实现标准的安防检测低到中等受限于供应商的检测目录
升级VMS或摄像头新平台,通常还包括新摄像头设备足够老旧,以至于分析并非真正的限制因素资本成本和推出时间
在现有视频流上自托管模型你自己的推理服务自定义检测、绝对的数据边界,或者你所发布的产品高,且持续进行你负责准确性、计算和维护

路线 1:在现有VMS之上的分析层#

这是默认推荐。这些产品的存在就是为了在不更换摄像头设备的情况下为其添加检测能力,对于标准的安防用例,它们比你自建任何东西都要更快、更便宜。

BriefCam。 一个视频内容分析层,在对录像进行快速回顾和跨录像搜索方面最为强大,可本地部署。最适合调查工作繁重、主要工作负载是在历史视频中查找事件的环境。权衡:它位于VMS之上,是增加了一个组件而非替换组件。

IronYun / Vaidio。 一个AI分析层,旨在为现有摄像头和VMS平台带来检测能力,拥有广泛的安全检测目录。最适合希望获得更多分析功能而不触及录像基础设施的组织。权衡:集成链条中多了一个需要测试和维护的供应商。

Lumana。 专注于为现有摄像头设备添加AI,关注改造路径本身,而不是假设为绿地安装。最适合明确要求保留当前摄像头的团队。权衡:相对于成熟的VMS供应商,这是一个较新的进入者。

Volt.ai。 同样致力于在现有监控基础设施之上叠加AI,并将集成指导作为其产品的重要组成部分。最适合在混合摄像头硬件之间进行改造的组织。权衡:与任何覆盖层一样,结果的质量仍然取决于底层摄像头。

从这四个产品中你能获得的内容:标准检测(人员和车辆出现、越线检测、区域入侵、徘徊、遗留物、人群密度、跨录像的基于属性的搜索),并伴有技术支持和对准确性负责的人。你无法获得的内容:不在目录中的检测。

一个关于范围的说明。其中几款产品将跨录像的属性搜索作为卖点,而供应商在“这究竟是指匹配衣着颜色等描述性属性”还是“匹配身份”这一点上存在很大差异。这是具有本质区别的两种能力,其法律风险截然不同,因此值得确立你买的是什么以及你实际想要的是什么。将范围限制在属性和事件检测而非身份识别上,既能简化合规沟通,又能满足大多数安防工作流的需求。

路线 2:升级VMS或摄像头#

有时最诚实的答案是,限制因素在于设备本身,而不是分析技术。如果摄像头陈旧、位置不佳、无法打补丁且以低帧率录像,那么在其之上叠加AI只会带来失望。

Genetec Security Center。 集成了视频、访问控制和ALPR的系统,拥有强大的网络安全和隐私工具,可本地部署。最适合需要统一物理安全的大型企业和公共部门设备。权衡:这是一个庞大的平台,需要相应的专业知识。

Milestone XProtect。 一个开放平台的VMS,拥有庞大的第三方集成生态系统,因此可以独立于录像层来选择分析功能。最适合希望保持这种选择开放的组织。权衡:必须有人负责集成组装。

Avigilon Unity。 本地视频安防,内置分析功能,摄像头与软件的集成度极高。最适合希望从单一供应商获取连贯技术栈的团队。权衡:在采用其自家摄像头时效果最强。

Verkada。 云管理的摄像头,内置分析功能,高度强调部署和管理的便捷性。最适合现场IT资源有限的分布式多站点组织。权衡:云管理架构,某些数据驻留要求会将其排除在外。

Rhombus。 同样是云管理且包含分析功能,旨在实现简便的多站点推广。最适合希望快速部署的中端市场组织。权衡:同上,当视频必须保留在本地时,云模型会成为一种限制。

Eagle Eye Networks。 采用开放API方法和分析选项的云视频管理。最适合希望拥有云管理同时保留集成灵活性的组织。权衡:以云为中心的架构。

Axis Camera Station。 直观的本地视频管理,搭配Axis摄像头和机载分析,并拥有异常详细的硬件来源文档。最适合中等规模的Axis部署。权衡:相比企业级平台,它不太适合非常大的多站点设施。

如果涉及数据驻留、气隙隔离或采购限制等要求,那么在其他任何因素起作用之前,这些要求就会缩小这份名单。驱动这些决策的合规框架在我们的安防合规本地视频分析指南中有更深入的探讨。

路线 3:在现有视频流上自托管模型#

这是少数派选择的路线,但在特定条件下它是正确的选择:

  • 检测不在任何目录中。 特定的设备、设施特定的条件、流程状态、生产线上的产品。通用安防分析无法配置成新颖的类别。- 推理边界是绝对的。 不仅仅是存储。任何图像都不得离开网络进行分析,包括发送到供应商的云层。- 你正在交付产品。 如果分析是你所销售产品的一个功能,那么按通道计费就不符合成本模型,你属于构建者。- 按通道计费无法在你的视频流数量下扩展,并且你具备运营替代方案的工程能力。- 你需要控制模型的生命周期,随着场地的变化利用自己的视频进行重新训练,而不是等待供应商发布版本。

如果不满足这些条件,请选择路线 1。

架构#

保留VMS。 录像、保留、访问控制和审计日志都是已解决且与合规相关的问题。从它那里消费视频流;不要替换它。

将RTSP流拉入你自己的推理服务。在分辨率允许的情况下,优先选择摄像头的子码流。它的解码成本要低得多,而且解码往往是真正的瓶颈,而不是推理。

运行检测和跟踪。 Ultralytics YOLO 模型(YOLOv8、YOLO11和YOLO26)涵盖了相关任务:用于人员、车辆和对象的检测,用于越线和区域逻辑的跟踪,用于姿态和跌倒检测的姿态估计,以及在边界比方框更重要时的分割。导出为 ONNX 或 TensorRT 以适配你正在部署的硬件。

使用你自己的视频进行训练。 通用模型能很好地处理人员和车辆。你具体的摄像头、角度、天气和光照决定了生产环境的准确度,公共数据集无法代表这些。Ultralytics Platform 可以通过基于 SAM 的智能标注(Smart Annotation)对场地视频进行标注,并在同一个工作流中进行训练,当替代方案是将标注和训练工具拼凑在一起时,这一点至关重要。

将事件写回安防工作流。 检测结果应该进入操作员已经在观看的VMS或告警管理系统中。一个独立的仪表板最终会成为一个没人打开的孤立系统。

在试点进入生产环境之前解决许可问题。Ultralytics YOLO 模型在 AGPL-3.0 许可下提供,商业或专有部署通常需要 Ultralytics Enterprise 许可证,该许可证还涵盖私有部署和高级支持。在设计阶段解决这个问题,远比在全面推广之后解决要便宜得多。

计算资源规模评估#

在许多视频流上进行持续推理是一项容量规划任务,其中有两个主要杠杆。

第一个是帧率。大多数安防事件不需要每一帧。根据你必须捕获的最短事件来设置帧率(跨越线条的人员所需的帧率远低于30fps),容量需求通常会大幅下降。

第二个是推理运行的位置。摄像头附近的边缘设备避免了通过网络传输视频并将视频保留在本地,这往往是核心诉求。中央GPU服务器更易于操作和管理,但会集中带宽需求。混合设备通常两者兼顾:在远程站点进行边缘推理,在网络状况良好的地方进行集中处理。

在你自己的视频流和硬件上进行基准测试。在精选数据集上测得的模型吞吐量数据,并不能预测解码加推理管道在你的摄像头上能达到什么效果。

误报应该在模型之上解决,而不是在模型内部解决#

自建系统最常见的失败原因不是检测准确率差,而是告警数量多到让操作员在两周内就不再响应。

检测并不等于事件。将方框转换为告警的层级,才是真正控制误报率的地方:

  • 持久性。 要求轨迹在多帧中建立后才算数。单帧检测属于噪声。
  • 现实坐标中的区域几何形状。在2D图像上绘制的多边形并非地面上的区域。如果没有透视校准,危险区外围的人可能会显得在危险区内部。
  • 去抖动。 在门槛处徘徊的一个人,不应产生重复的越线事件。
  • 时间表和豁免。 下午2点叉车在过道里是正常的,凌晨2点则不然。对这一点进行编码可以消除很大一部分告警。
  • 升级层级。 并非每一次检测都值得触发告警。实时告警、班次总结和每周趋势是三个具有不同准确性要求的不同输出。

预计这一层级编写的代码会比模型集成更多,并且应以每班误报数而不是测试集上的检测准确率来衡量系统。每班误报数决定了系统在三个月后是否还处于开启状态。

隐私与范围#

将分析功能改造到现有的摄像头上会改变这些摄像头的功能,这通常会触发最初安装时所没有的义务。

  • 目的限制。 为安防安装的摄像头不应该悄悄变成生产力或行为监控工具。在工作场所环境中,这既是一个法律问题,也是一个信任问题。
  • 重新评估,不要继承。 将自动化分析添加到现有视频中通常需要进行全新的数据保护评估,在欧盟的大部分地区,还需要进行工会咨询。
  • 排除身份匹配。人员和车辆检测、越线、区域入侵、徘徊、人群密度以及遗留物检测,都基于匿名检测。Ultralytics 不提供用于面部识别的模型,且身份匹配在不提升任何上述检测效果的同时,会带来显著更重的法律风险。
  • 最小化保留内容。 如果事件和计数就能回答问题,那就只保留事件和计数。
  • 记录查看和导出操作,而不仅仅是记录配置更改。
  • 对摄像头网络进行分段。 系统改造是修复扁平网络和默认凭据的好时机。

常见问题解答

  • 三条路线。购买一个消费你现有视频流的分析层(BriefCam、IronYun/Vaidio、Lumana 或 Volt.ai),这是实现标准安防检测最快的途径。如果设备本身是限制因素,则升级VMS或摄像头。或者在你现有的RTSP流上自托管检测模型,这适合自定义检测、绝对的数据边界以及你所发布的产品。首先审计摄像头的分辨率、角度和低光照性能,因为这决定了哪些路线是可行的。

  • 不能。核心限制因素包括你在意的距离处目标上的像素、摄像头角度、低光照性能以及实际存储的帧率。预计结果会分化:许多摄像头足以应对存在和区域检测,少数可用于详细分类,还有一些无论你选择哪条路线都需要重新定位。

  • 通常不需要。分析层的构建就是为了消费来自现有VMS的视频流,而自托管模型可以直接读取RTSP,同时VMS继续处理录像、保留和审计日志。当平台本身不受支持、无法打补丁或无法提供视频流访问时,更换VMS才有意义。

  • 对于标准的安防检测,请购买。按通道计费几乎总是比构建和维护管道的总成本更便宜,后者包括GPU容量、工程时间、标注、重新训练、监控和值班。当你需要的检测在任何目录中都不存在、当许可无法随视频流数量扩展、或者当分析是你所销售产品的一个功能时,自己构建才是胜出之选。

  • 不需要,并且值得明确将其排除在外。存在、越线、区域入侵、徘徊、人群密度和遗留物检测都基于匿名检测。一些供应商将基于属性的跨录像搜索作为卖点;请确认这究竟是指描述性属性还是身份匹配,因为两者的法律风险截然不同。Ultralytics 不提供用于面部识别的模型。

  • 摄像头附近的边缘推理避免了跨网络发送视频并将视频保留在本地,这往往是驱动该项目的需求。中央GPU服务器更易于操作和监控,但会集中带宽需求。混合设备通常在远程站点运行边缘推理,并在网络支持的地方进行中央推理。

  • 这必须进行测量,因为它取决于分辨率、模型大小、推理帧率以及视频解码占用了多少预算而不是推理。最有效的杠杆是帧率:根据你必须捕获的最短事件(而不是摄像头的最大值)来设置帧率,通常会大幅增加视频流容量。在调整硬件规模之前,请在你自己的视频流上进行基准测试。

  • 几乎总是因为模型之上的逻辑缺失,而不是因为检测效果差。添加跨多帧的持久性要求、将区域几何形状校准到现实坐标、对重复越线进行去抖动,并对时间表和豁免进行编码。然后以每班误报数进行衡量,这个数字决定了操作员是否会继续信任该系统。

Explore solutions

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅