使用 Ultralytics YOLO 模型改进碰撞预测
了解 Ultralytics YOLO 模型提供的洞察如何帮助碰撞预测系统在动态环境中做出更安全、更迅速的决策。

即使在道路上十分谨慎,事故仍然可能发生。汽车突然变道,行人横穿马路,或骑行者毫无预警地加速。这些日常场景都说明了碰撞预测系统能够发挥重要作用,帮助保障每个人的安全。
此前,我们研究了球体轨迹预测,了解了如何预测快速移动球体的路径,从而帮助体育分析理解运动并预判接下来会发生什么。碰撞预测的工作方式与此类似。
这些预测系统本质上是在观察未来。通过观察车辆和行人的移动方式,它们可以及早发现风险,并在情况变得危险之前调整路径或行为(也称为运动规划或路径规划)。
碰撞预测系统背后的关键计算机科学技术是人工智能及其子领域,例如计算机视觉,以及帮助预测物体移动方式的预测方法。例如,Ultralytics YOLO11和即将推出的Ultralytics YOLO26等计算机视觉模型可以实时检测和跟踪车辆、行人等物体,而预测模型则利用这些信息估计它们接下来的移动。

图 1. 使用 YOLO11 检测道路上物体的示例(来源)。
最终得到的是一个能够理解周围发生了什么,并支持动态环境中更明智决策的 AI 系统。在本文中,我们将探讨碰撞预测的工作原理及其背后的方法,以及计算机视觉和 Ultralytics YOLO 模型在其中所能发挥的作用。让我们开始吧!
什么是碰撞预测?#
碰撞预测是指 AI 系统理解物体如何移动,并预判它们何时可能非常接近或发生接触的能力。不同系统可以通过多种方式使用这些信息,包括支持安全功能、优化移动,或协调共享空间中的行动。
只要物体在共享空间中移动,无论是高速公路上的汽车、仓库通道中的叉车,还是穿过街道的行人,碰撞预测都能帮助系统理解这些交互可能如何发展。在注重安全的应用中,这种预见能力可用于降低风险;在其他场景中,它则可以支持路线规划、时间安排或协调移动等任务。
例如,许多配备高级驾驶辅助系统(ADAS)的新型车辆会使用摄像头和传感器监控前方道路,并估计汽车接近附近物体的速度。如果系统检测到情况可能变得不安全,就会提醒驾驶员;在某些情况下,自动制动还可以帮助减轻碰撞影响。
探索碰撞预测的四个阶段#
碰撞预测是一个协调过程,不同的 AI 组件协同工作,以识别物体、跟踪其移动,并估计接下来可能发生的情况。这些系统通常分为四个相互关联的阶段:物体检测、物体跟踪、轨迹预测,最后是碰撞预测;每个阶段都建立在前一阶段准确性的基础上。
接下来,让我们仔细了解每个阶段的工作方式。
了解物体检测#
物体检测是计算机视觉中的一项核心任务,视觉 AI 模型会在图像或视频帧中识别并定位物体。通过分析像素数据,物体检测模型可以输出三项主要结果:边界框、物体类别和置信度分数。边界框显示物体所在的位置,物体类别表示它是什么,例如汽车、行人或骑行者,而置信度分数则反映模型对预测结果的确定程度。
YOLO11 和 YOLO26 等视觉 AI 模型以此为基础,支持多项相关任务,包括物体检测、物体跟踪和定向边界框(OBB)检测。物体检测可以告诉预测系统每一帧中有什么,跟踪则会跟随这些物体的移动,而定向边界框能够为以不同角度出现的物体提供更准确的形状。
在这一阶段,碰撞预测系统只专注于理解视觉数据中存在什么。它构成了后续所有步骤所依赖的信息基础层,但此时还不会考虑物体将如何移动或交互。
物体跟踪概览#
检测到物体后,下一步是跨帧跟踪它们,以便系统理解它们如何随时间移动。检测会在每一帧提供新的边界框,而物体跟踪则通过跨时间关联这些检测结果来保持连续性。
Ultralytics Python 软件包支持的跟踪算法(例如 ByteTrack 或 BoT-SORT)可以与 YOLO11 等模型配合使用,通过利用每一帧的检测数据跟随物体移动。这些算法会为每个物体分配唯一 ID,即使物体快速移动或部分被遮挡,也能借此保持其身份。这会形成连续平滑的跟踪历史,记录物体的移动方式。

图 2. 使用 YOLO 为不同检测结果分配唯一 ID(来源)
下面快速了解这两种跟踪方法的工作方式:
- **ByteTrack:**它同时使用高置信度和低置信度检测结果来保持一致的物体 ID,并利用 Kalman Filter 的运动预测帮助跟踪器在物体快速移动或短暂难以检测时保持稳定。
- **BoT-SORT:**该算法通过将 Kalman Filter 运动预测与外观特征相结合扩展了 SORT,使跟踪器能够在拥挤场景或发生部分遮挡时更可靠地跟踪物体。
为了衡量这些跟踪方法的表现,研究人员会在成熟的多目标跟踪(MOT)数据集和基准上进行评估。常用指标还包括多目标跟踪准确率(MOTA),它反映整体跟踪质量;识别 F1 分数(IDF1),它衡量物体身份保持的一致性;以及高阶跟踪准确率(HOTA),它综合反映检测性能和关联准确性。
理解轨迹预测#
跨多个帧跟踪物体后,下一步是预测它接下来会前往哪里。这称为轨迹预测。检测用于发现物体,跟踪用于跟随其移动方式,而预测则会向前观察并估计物体未来的位置。
检测和跟踪得到的信息,例如物体的边界框、跨帧位置以及分配的 ID,可以用于计算速度、方向和移动模式等运动特征。这些派生信息为预测模型提供所需数据,使其能够估计物体在接下来几秒内可能所在的位置。
当跟踪数据存在间断或突然跳变时,插值技术可以帮助重建更加平滑、一致的轨迹。这样可以确保预测模型接收到高质量的运动输入,而不是嘈杂或不完整的位置数据。

图 3. 预测汽车轨迹的可视化效果。(来源)
为了进行这些预测,许多系统依赖专门用于理解物体运动如何随时间变化的深度学习模型。通过分析过去的位置序列及其派生的运动特征,这些模型可以学习常见的移动模式,并利用这些知识预测未来路径。
以下是一些常用于轨迹预测的深度学习和机器学习方法:
-
**循环神经网络(RNNs):**RNNs 是专门处理序列的深度学习模型,例如一系列视频帧。它们可以记住先前的位置,并利用这些信息理解物体一直以来的移动方式。这有助于系统识别加速、减速或直线移动等简单运动模式。
-
**长短期记忆网络(LSTMs):**LSTMs 是更先进的一类 RNN,能够记住更长时间的信息。这使它们可以捕捉更复杂的移动,例如车辆准备转弯或行人改变方向。由于能够跟踪更长期的趋势,它们通常能在繁忙环境中产生更可靠的预测。
-
**Transformer:**Transformer 会处理完整的运动序列,并使用注意力机制聚焦于这些序列中最重要的细节。因此,它们尤其适合处理多个物体发生交互的场景,例如汽车并线或行人交叉通行。
这些模型可以预测短期和长期路径。短期预测通常不超过两秒,准确性往往最高;而两到六秒等更长时间窗口的预测虽然能提供更多预见,但也伴随着更大的不确定性。
综合起来:碰撞检测算法#
在最后的碰撞预测阶段,系统会利用目前为止所学到的一切:每个物体是什么(检测)、它如何移动(跟踪),以及它接下来可能前往哪里(预测)。这一步会检查预测路径是否可能以某种方式相交,从而导致碰撞。

图 4. 碰撞预测系统的工作方式(来源)
以自动驾驶车辆为例,碰撞检查系统会比较汽车、行人和骑行者等附近物体的未来轨迹。如果两条预测路径重叠或危险地接近,系统就会将其标记为潜在的车辆碰撞。为了了解碰撞风险可能有多紧迫,系统还会计算一个称为碰撞时间的数值。
碰撞时间(TTC)是快速移动环境中的一项关键测量指标。它估计如果两个物体继续以当前速度和方向移动,距离发生碰撞还剩多少时间。当 TTC 低于某个阈值时,系统可以通过发出警告、施加制动或调整规划路径来作出响应。
碰撞预测的实际应用#
碰撞预测正成为交通管理、智慧城市基础设施、工业自动化和移动机器人等众多行业的关键技术。随着先进的计算机视觉和预测模型不断发展,这些系统预测移动的能力也越来越强。
现在我们已经更好地了解了碰撞预测和轨迹预测的工作方式,接下来让我们看看一些有趣的研究,了解这些方法如何应用于各种现实环境。
YOLO 驱动的应急自动驾驶车辆碰撞预测#
在拥挤且不可预测的环境中导航,是自动系统面临的最困难挑战之一,尤其是在行人的移动方式不遵循明确模式时。应急车辆更经常遇到这一问题,因为它们需要在密集的公共空间中高速快速通行,且不能依赖结构化道路、车道线或可预测的行人行为。
在此类场景中,了解人员所在位置以及他们在接下来几秒内可能如何移动,对于避免事故至关重要。例如,近期一项研究通过为在人流密集环境中运行的应急自动驾驶车辆(EAV)构建完整的碰撞预测流程,探索了这一挑战。
YOLO 驱动的碰撞预测流程如何工作#
下面快速了解这种方法的工作方式:
- **使用 YOLO 检测行人:**基于 YOLO 的检测器会识别每个摄像头帧中的行人,并为每个可见人员输出边界框。
- **使用 ByteTrack 跟踪运动:**ByteTrack 算法会跨帧关联这些检测结果,为每名行人分配一致的 ID,并创建记录其随时间移动方式的运动历史。
- **估计现实世界位置:**逆透视映射(IPM)会将 2D 像素坐标转换为近似的地面平面位置,帮助系统理解行人在现实空间中相对于车辆的位置。
- **使用 cGAN 生成鸟瞰图:**条件生成对抗网络(GAN)是一种能够将一种图像格式转换为另一种格式的 AI 模型,它会创建场景的鸟瞰图表示。这种俯视布局更便于解读行人的位置及其周围环境。
- **使用 LSTM 模型预测轨迹:**LSTM 模型利用每名行人过去的位置和移动模式,预测他们在接下来几秒内可能移动到哪里。
- **使用碰撞锥高效检测碰撞:**系统会使用碰撞锥方法比较预测轨迹,判断车辆与任意行人的路径是否有相交趋势。
- **通过信号避免碰撞:**如果系统预测到碰撞,就会在最佳时机启动听觉信号(例如喇叭或铃声)。系统会选择合适的时机来影响行人行为,让他们有机会加速或减速并到达安全地点。
使用边缘视觉和 YOLO 保障城市行人安全#
类似地,另一种碰撞预防方法不再局限于车辆,而是将重点放在基础设施本身。该方法不依赖车内传感器,而是使用安装在人行横道和交叉路口的智能摄像头,实时监控行人和车辆的移动。这些地点通常难以预测:人们可能突然走上道路,骑行者可能穿行于车流之间,驾驶员也不一定会减速,因此及早检测风险至关重要。
一项有趣的研究通过名为NAVIBox的系统探索了这一想法。NAVIBox 是一种边缘视觉设备,旨在直接在交叉路口预测车辆与行人之间的风险。该系统使用Ultralytics YOLOv8模型检测行人和车辆,并使用轻量级 Centroid 跟踪器跨帧跟踪它们。这样可以形成简短而可靠的运动历史,随后再通过透视变换进行优化,将倾斜的 CCTV 视角转换为更清晰的道路鸟瞰布局。
借助这些优化后的轨迹,NAVIBox 可以估计道路使用者在接下来几秒内可能如何移动,并检查他们的路径是否可能相交(也称为交叉测试)。当系统检测到危险交互时,会立即通过面向驾驶员的显示屏和面向行人的扬声器发送警告,而无需依赖远程服务器或网络连接。在真实城市环境中的测试表明,NAVIBox 的运行速度足以实现真正的实时响应,并能准确识别潜在碰撞场景,因此它是繁忙城市交叉路口中实用的安全工具。

图 5. 预测车辆与行人之间的碰撞风险。(来源)
碰撞检测与预测的优缺点#
以下是使用 AI 支持的预测碰撞系统的一些优势:
-
**提升态势感知能力:**AI 系统会持续绘制环境中物体的移动情况,从而更全面地理解大规模人群流动、交通行为或机器路径。
-
**为长期规划提供数据驱动的洞察:**通过记录检测结果、险些碰撞事件和移动模式,AI 系统可以提供分析数据,帮助城市规划者、安全团队和车队运营商重新设计交叉路口、改进标识或优化运营政策。
-
**经济高效地预防风险:**通过在风险升级前进行检测,这些系统可以帮助避免代价高昂的事故、保险理赔或设备维修。
尽管具有诸多优势,无碰撞系统仍面临一些限制。以下是需要考虑的几个挑战:
- **传感器和摄像头安装位置限制:**位置或角度不当的摄像头可能会扭曲物体大小或距离,使深度估计和轨迹预测的可靠性降低。
- 遮挡:物体可能被其他物体部分或完全遮挡。当模型失去视觉连续性时,物体跟踪会变得困难。
- 环境条件:光线不足、强烈阳光、雨、雾或摄像头质量较差,都会降低模型清晰观察场景的能力,从而影响准确性。
要点总结#
碰撞预测结合了两项强大能力:计算机视觉让系统能够理解环境中当前正在发生的事情,而轨迹预测则帮助系统预判接下来可能发生的情况。
结合这些优势,机器可以实时检测移动物体,并预测这些物体在未来几秒内可能如何交互。随着计算机视觉和预测技术不断发展,碰撞预测很可能会成为构建更安全、更可靠且可扩展的自动系统的关键技术。
访问我们的社区和 GitHub 代码仓库,了解更多 AI 相关信息。在我们的解决方案页面上探索医疗保健中的 AI和制造业中的计算机视觉等应用。了解我们的许可选项,立即开始构建!









