人员计数和占用分析的实际工作原理
人员计数和占用分析的工作原理:对比 WiFi、ToF、热成像和基于相机的视觉方法、可用产品以及如何构建。

大多数人流量统计项目在选择任何传感器之前就已经偏离方向了,因为“有多少人”其实包含四种不同的测量维度,而团队往往指定了错误的维度。一天的进出人次、当前在场人数、每个人停留的时长以及排队等候的人数,需要不同的传感技术、不同的安装位置和不同的准确度。一个能准确统计进出人次的系统可能会把空间占用率报得很糟,而专为空间占用优化的系统则可能会漏掉所有的短暂停留。
本指南对这些测量维度进行了区分,客观地比较了各种传感方法(Wi-Fi 和蓝牙、红外对射、飞行时间、热成像、立体视觉和基于摄像头的视觉),并介绍了值得购买的产品,以及团队如何使用 Ultralytics YOLO 模型自行构建基于摄像头的统计系统。
四个测量维度,而非一个#
| 测量维度 | 回答的问题 | 所需条件 | 常见失败原因 |
|---|---|---|---|
| 进出人次 / 客流量 | 今天进来了多少人? | 在每个入口处进行定向计数 | 将员工、送货人员和重复进出的访客计算在内 |
| 空间占用 | 现在里面有多少人? | 准确的进出计数,或全区域传感 | 小的方向误差在一整天内累积成巨大的偏差 |
| 停留时间 | 人们停留了多久? | 在整个区域内跟踪无身份特征的轨迹 | 因遮挡丢失轨迹,随后将返回重复计算 |
| 排队长度与等待时间 | 有多少人在排队,等了多久? | 基于区域的计数加上计时 | 当队伍不是整齐的直线时,难以界定起点 |
空间占用是让团队感到意外的指标。通过进场人数减去出场人数推导该指标意味着每个计数误差都会叠加:在门口的每一次移动中重复产生微小的方向误差,到闭店时就会导致统计数字出现严重偏差。需要可靠空间占用数据的系统要么直接对整个区域进行传感,要么在已知空置的状态(通常是夜间)重置计数。
传感方法对比#
| 方法 | 工作原理 | 优势 | 局限性 | 隐私概况 |
|---|---|---|---|---|
| Wi-Fi / 蓝牙 | 检测设备信号 | 覆盖范围广,无需天花板安装,在已有 AP 的地方成本低 | 统计的是设备而非人数;漏掉关闭或随机化 MAC 的手机;精度较低 | 无图像;在许多地区设备标识符仍属于个人数据 |
| 红外对射 | 跨越门框的断光感应 | 非常便宜、简单、低功耗 | 无方向性(除非成对使用);并肩行走的多人被算作一人 | 极低 |
| 飞行时间 (ToF) | 区域的顶部深度传感 | 方向计数准确,对光照鲁棒,在黑暗中可用 | 单台设备覆盖范围窄且固定;宽入口需要更多设备 | 无可识别图像 |
| 热成像 | 检测人体热辐射特征 | 黑暗中可用;天生匿名 | 当环境温度接近体温时性能下降;分辨率较低 | 强 —— 无可识别图像 |
| 立体视觉 | 双镜头推导深度 | 精度高且具备高度过滤功能,可排除儿童或手推车 | 单机成本较高;需要仔细安装和校准 | 存在图像但通常在本地处理 |
| 基于摄像头的视觉 | 视频上的检测和跟踪模型 | 在您可能已有的摄像头上提供计数加上下文——排队、区域、方向、停留、对象类别 | 对光照、遮挡和摄像头角度敏感;需要计算能力 | 灵敏度最高;需要仔细设计 |
真正的权衡在于上下文与简单性之间。门上方的 ToF 传感器能把一件事做得极其出色,而不会告诉你其他任何信息。基于摄像头的视觉则从同一路视频流中为你提供方向、区域、停留、队列和对象类别,代价是需要应对光照、遮挡和算力问题。
对于只需要关注进出人数的单一入口,顶部 ToF 通常是更好的工程方案,隐私沟通也更简单。对于多区域分析、排队或必须与其他检测相结合的计数,视觉才是能扩展以满足需求的方案。
究竟是什么降低了计数准确度#
供应商引用的准确度数据是在极少类似于真实部署的条件下测得的。影响现实世界准确度的因素包括:
- 群体与并肩行走。 两个人并肩通过宽门是经典的漏数原因。门宽相对于传感器覆盖范围的比例比传感器的标称准确度更重要。
- 遮挡。 手推车、雨伞、行李、高大的展架和密集的人群crowd会使人从任何需要清晰视野的方法中隐藏起来。
- 摄像头角度。 顶部视角在计数方面远比倾斜视角准确,因为倾斜视角会使人群前后堆叠。以浅角度重新利用的安防摄像头是视觉计数令人失望的最常见原因。
- 光照。 日出和日落时的逆光入口是视觉方案最难处理的情况,反光地面和玻璃门也是如此。
- 在门槛处逗留。 某人站在门口聊天如果没有持久性规则,会产生重复穿行记录。
- 谁算作访客。 员工、清洁工、送货员和过路人通常是系统与人工审计之间产生分歧的最大单一来源,这是一个定义问题,而不是传感问题。
- 多摄像头重复计数。 重叠的视场会将同一个人计算两次,除非将区域定义为互斥的或者在摄像头之间进行轨迹移交。
无论部署什么系统,都要在最恶劣的条件下对照人工计数进行验证: 最忙碌的时段、最差的光照、最宽的入口。这些条件下的准确度才是最重要的数字。
如果准备购买,值得入围的产品#
如果目标是客流量报告、空间占用仪表盘或零售转化分析,这些都是成熟的产品,购买通常是正确的选择。Ultralytics 并不是它们的替代品。
Xovis。 顶部立体视觉传感器,对入口计数、排队管理和区域分析具有很高的准确度,广泛部署在机场和大型零售业。最适合计数准确度在运营上至关重要的环境。权衡:每个覆盖区域都需要传感器硬件,因此宽阔或众多的入口会增加成本。
V-Count。 专门针对零售业的人流量统计和分析,平台层涵盖客流量、空间占用和转化率报告。最适合想要开箱即用报告的多门店零售企业。权衡:零售风格的分析对于工业或园区环境不太自然。
Density。 专注于工作场所的空间占用测量,使用其自身的匿名深度传感器,围绕房地产和空间利用决策进行定位。最适合优化办公空间的的企业组合。权衡:专为工作场所问题而非零售转化而构建。
FootfallCam。 计数硬件加分析,具有广泛的零售覆盖范围和多种传感器选项。最适合希望从单一供应商处获得硬件和报告的零售商。权衡:型号众多,在规格选择时需要仔细挑选。
RetailNext。 店内分析平台,其中计数馈送至更广泛的商品陈列和购物者行为产品中。最适合关注店铺绩效而不仅仅是客流量的零售商。权衡:平台范围远超计数,定价也相应较高。
Sensormatic ShopperTrak。 历史悠久的零售客流量统计和基准测试,背后有大量的市场数据支持。最适合重视比较基准的零售商。权衡:面向企业级零售。
Axis。 在 Axis 摄像头上运行的计数应用程序,适用于已有 Axis 资产且不希望增加新硬件的情况。最适合标准采用 Axis 的组织。权衡:绑定到该摄像头生态系统。
Cisco Spaces。 从现有网络基础架构派生的空间占用和位置洞察。最适合需要空间占用数据又不想增加新传感器的的大型园区。权衡:基于设备的传感,意味着存在精度限制。
构建基于摄像头的计数系统#
计数是比较容易着手的视觉构建项目之一,这也是为什么它是常见的第一个项目。当计数是更大系统(机器、机器人、场地平台、你交付的产品)的一个组成部分、当计数必须与任何产品都不提供的检测相结合、或者当 footage 不能离开本地时,它就值得构建。
流水线已经很成熟。
每帧检测人员。 Ultralytics YOLO 模型(YOLOv8、YOLO11 和 YOLO26)负责人员检测,并且同一个模型可以在同一次处理中检测你关心的其他类别:车辆、手推车、叉车。
跨帧跟踪。 计数需要知道第 200 帧中的人就是第 199 帧中的那个人。Ultralytics 模型支持跟踪,它在整个序列中分配持久的、无身份特征的 ID,穿过遮挡时的跟踪质量对计数质量的影响远远大于检测准确度。
定义计数几何图形。 用于定向进出计数的线,或用于区域占用的多边形。方向由轨迹穿过线的哪一侧决定。在多个摄像头覆盖相邻区域的情况下,将区域定义为互斥的,这样就不会将同一个人计算两次。
添加持久性和消抖。 要求轨迹在被计入前必须在 N 帧中建立,并防止门槛处的单个逗留者产生重复穿行记录。这个层而不是模型,才是大多数准确度提升的来源。
尽早选择部署目标。 多个视频流的连续推理是一个实际的容量问题。大多数计数不需要每一帧:根据某人穿过线速度的快慢来设置帧率,而不是根据摄像头能提供的输出来设置。Ultralytics 模型可导出为 ONNX 和 TensorRT 等格式,用于摄像头附近的边缘硬件,这也使视频保持在本地。
使用你自己的 footage 进行训练。 通用模型能很好地处理人;你在日出时的特定入口(带有玻璃门和反光地面)才是决定生产环境准确度的关键。Ultralytics Platform 可以使用基于 SAM 的智能标注来对该 footage 进行标注,并在同一工作流中对其进行训练。
在最忙碌的时段和最差的光照条件下对照人工计数进行验证,并在任何摄像头移动后重新验证。
如果计数要进入商业产品或专有系统,请注意 Ultralytics YOLO 模型是在 AGPL-3.0 下提供的,此类部署通常需要 Ultralytics 企业许可,该许可也涵盖私有部署。在试点变成发布的功能之前解决这个问题。
隐私:计数不应识别任何人#
计数是少数几个可以通过设计做到真正保护隐私的摄像头应用之一,这样做可以在提出大多数反对意见之前消除它们。
这里描述的任何方法都不需要识别个人。 进出、空间占用、停留和排队长度全部基于匿名检测和无身份特征的轨迹,这些轨迹仅在人处于画面中时存在。Ultralytics 不提供用于面部识别的模型,在计数系统中构建身份识别会增加巨大的法律风险,同时对这些测量没有任何改进。
保持这一特性的设计选择:在本地处理并仅保留计数。 如果输出是每个时间间隔的一个数字,则保留该数字并丢弃视频帧。 - 不要在视场之外持久保存轨迹 ID。 在画面边缘结束的轨迹应该结束。在不同摄像头或不同访问之间重新识别同一个人是一个实质上不同的系统,带有实质上不同的义务。 - 在时间间隔上聚合,而不是记录单个事件(如果用例允许)。 - 发布通知,在工作场所等环境中,咨询员工代表:这是欧盟大部分地区的强制要求,也是各地的良好实践。 - 在只需要计数时首选天生匿名的传感方式。 如果 ToF 或热传感器能回答这个问题,沟通就会更轻松。 - 记录每个摄像头的用途,这使得数据保护评估变得简单。
- 注意,“没有摄像头”并不自动意味着“更具隐私性”。Wi-Fi 和蓝牙计数基于设备标识符工作,在许多情况下,根据 GDPR 这些属于个人数据,而仅产生计数的传感器根本不处理个人数据。根据方法保留了什么来判断它,而不是根据它是否涉及镜头。
注意,“没有摄像头”并不自动意味着“更具隐私性”。Wi-Fi 和蓝牙计数基于设备标识符工作,在许多情况下,根据 GDPR 这些属于个人数据,而仅产生计数的传感器根本不处理个人数据。根据方法保留了什么来判断它,而不是根据它是否涉及镜头。
常见问题解答
对于零售客流量和转化分析:V-Count、RetailNext、ShopperTrak 和 FootfallCam。对于高精度出入口和排队计数:Xovis。对于工作场所空间占用和空间利用率:Density,或者在网络传感足够时使用 Cisco Spaces. 对于作为你正在构建的系统组件的计数,基于相机的视觉结合 Ultralytics YOLO 模型是通常的选择。
顶置传感(如飞行时间或立体视觉)通常对出入口计数最准确,因为自上而下的视角在很大程度上消除了人与人之间的遮挡。当安装在顶部时,基于相机的视觉方法可以达到这种准确度,而在倾斜角度下准确度会显著下降。WiFi 和 BLE 精确度最低,因为它们数的是设备而不是人。
这几乎完全取决于相机角度、光照和人群密度,而不是模型本身。在均匀光照下的顶置相机,其表现与在逆光玻璃入口上方采用浅角度的改造监控相机截然不同。请在最忙碌的一小时内与人工计数进行验证,而不要依赖任何公布的数据。
通常可以,但有一个前提:为安全而放置的摄像头的角度是为了看清人脸和广阔区域,这几乎是计数最糟糕的几何视角。对于区域空间占用趋势,可以期待满意的结果,而对于精确的出入口计数,结果则不太可靠。在入口处增加一个顶置相机通常比针对糟糕角度调优模型效果更好。
不需要。这里的所有测量(进出人数、空间占用、停留时间、排队长度)都基于匿名的行人检测以及仅在有人在画面中时存在的无身份轨迹。添加身份识别会增加法律风险,但不会提高计数准确性。
要么按方向计算进出人数并维护一个运行中的总数,要么直接感知整个区域。第一种方法更便宜,但一天下来会累积误差,因此需要在已知为空的状态下定期重置。第二种方法更稳健,但需要覆盖整个空间。
最常见的原因是定义问题而不是传感问题:员工、送货人员、清洁工以及路过未停留的人。在比较数字之前,先商定好什么才算作访问者。之后,常见的技术原因是一并并排走路的人群、遮挡以及重叠的相机区域导致重复计数。
如果需求是客流量或空间占用报告,建议购买。这些产品已经成熟,构建报告层的总成本通常被严重低估。当计数是更大系统的一个组件、当它必须与任何产品都不提供的检测相结合、或者当视频不能离开现场时,选择自己构建。






