Ultralytics YOLOモデルによる衝突予測の改善
Ultralytics YOLOモデルから得られるインサイトが、動的な環境で衝突予測システムのより安全かつ迅速な意思決定に役立つ方法を学びます。

道路上で注意していても、事故は起こる可能性があります。車が車線変更をしたり、歩行者が横断歩道のない場所を横断したり、自転車が予告なく速度を上げたりすることがあります。こうした日常の出来事は、衝突予測システムが大きな違いを生み、すべての人の安全確保に役立つ場面の例です。
以前、ボールの軌道予測について取り上げ、速く動くボールの軌道を予測することで、スポーツ分析が動きを理解し、次に起こることを予測できるようになる仕組みを見ました。衝突予測も同様の方法で機能します。
これらの予測システムは、基本的に未来を見通します。車両や歩行者の動きを監視することで、リスクを早期に検知し、危険な状況に至る前に進路や行動を調整できます(これはモーションプランニングまたはパスプランニングとも呼ばれます)。
衝突予測システムを支える主要なコンピューターサイエンス技術は、人工知能とそのサブフィールドであるコンピュータービジョン、および物体の動きを予測するための予測手法です。例えば、Ultralytics YOLO11や近日公開予定のUltralytics YOLO26などのコンピュータービジョンモデルを使用すると、車両や歩行者などの物体をリアルタイムで検出・追跡できます。また、予測モデルはそこから得られた情報を使って、次の動きを推定します。

図1. YOLO11を使用して道路上の物体を検出する例(出典)。
その結果、周囲で何が起きているかを理解し、動的な環境でより適切な意思決定を支援するAIシステムが実現します。この記事では、衝突予測の仕組み、その基盤となる手法、そしてコンピュータービジョンとUltralytics YOLOモデルが果たせる役割について説明します。早速始めましょう。
衝突予測とは何ですか?#
衝突予測とは、AIシステムが物体の動きを理解し、それらが非常に近づいたり接触したりする可能性のあるタイミングを予測する能力です。さまざまなシステムがこの情報を多様な方法で活用でき、安全機能の支援、動きの最適化、共有空間における行動の調整などに役立ちます。
高速道路を走る車、倉庫の通路を走行するフォークリフト、道路を横断する歩行者など、物体が共有空間を移動する場所では、衝突予測によって、こうした相互作用がどのように展開する可能性があるかをシステムが理解できます。安全性を重視するアプリケーションでは、この先読みをリスク低減に利用できます。一方、その他の環境では、ルート計画、タイミング調整、協調的な移動などのタスクを支援できます。
例えば、高度運転支援システム(ADAS)を搭載した比較的新しい多くの車両では、カメラとセンサーが前方の道路を監視し、車が近くの物体にどの程度の速度で接近しているかを推定します。システムが危険な状況になる可能性を検知すると、ドライバーに警告し、場合によっては自動ブレーキによって衝撃を軽減できます。
衝突予測の4つの段階を詳しく見る#
衝突予測では、複数のAIコンポーネントが連携して物体を特定し、その動きを追跡し、次に起こる可能性を推定します。通常、これらのシステムは、物体検出、物体追跡、軌道予測、そして最終的な衝突予測という、相互に関連する4つの段階で動作します。各段階は、直前の段階の精度を基盤としています。
ここからは、それぞれの段階の仕組みを詳しく見ていきましょう。
物体検出について#
物体検出は、画像やビデオフレーム内の物体をビジョンAIモデルで特定し、位置を特定する、コンピュータービジョンの中核タスクです。物体検出モデルはピクセルデータを分析し、主に3つの出力を生成できます。バウンディングボックス、物体クラス、信頼度スコアです。バウンディングボックスは物体の位置を示し、物体クラスは車、歩行者、自転車など、それが何であるかを示します。信頼度スコアは、モデルがその予測をどの程度確信しているかを表します。
YOLO11やYOLO26などのビジョンAIモデルは、この基盤の上に構築され、物体検出、物体追跡、回転バウンディングボックス(OBB)検出など、複数の関連タスクをサポートします。物体検出は各フレームに何が存在するかを予測システムに伝え、追跡は物体の移動を追い、回転バウンディングボックスはさまざまな角度で現れる物体をより正確な形状で表します。
この段階では、衝突予測システムは視覚データに何が存在するかの理解だけに集中します。これは後続のすべてのステップが依存する情報の基盤となりますが、物体がどのように移動・相互作用するかはまだ考慮しません。
物体追跡の概要#
物体が検出されたら、次のステップではフレーム間で物体を追跡し、時間の経過に伴う動きをシステムが理解できるようにします。検出が各フレームで新しいバウンディングボックスを提供するのに対し、物体追跡は、それらの検出結果を時間的に関連付けることで連続性を加えます。
Ultralytics PythonパッケージがサポートするByteTrackやBoT-SORTなどの追跡アルゴリズムは、各フレームの検出データを使って物体の移動を追跡し、YOLO11などのモデルと連携します。これらのアルゴリズムは各物体に一意のIDを割り当て、物体が速く移動したり一部が隠れたりしても、そのIDによって同一性を維持します。これにより、物体の移動を捉えた滑らかな追跡履歴が作成されます。

図2. YOLOを使用して異なる検出結果に一意のIDを割り当てる方法(出典)
ここでは、これら2つの追跡手法の仕組みを簡単に見てみましょう。
- ByteTrack: 高信頼度と低信頼度の両方の検出結果を使用して、一貫した物体IDを維持します。Kalman Filterによるモーション予測も利用するため、物体が速く移動したり、一時的に検出しにくくなったりした場合でも、トラッカーを安定させることができます。
- BoT-SORT: このアルゴリズムは、Kalman Filterによるモーション予測と外観情報を組み合わせてSORTを拡張します。これにより、混雑したシーンや部分的なオクルージョンが発生している状況でも、トラッカーがより確実に物体を追跡できます。
これらの追跡手法の性能を測定するため、研究者は確立されたマルチオブジェクト追跡(MOT)データセットやベンチマークで評価します。一般的に使用される指標には、追跡全体の品質を表すマルチオブジェクト追跡精度(MOTA)、物体の同一性がどの程度一貫して維持されているかを測定する識別F1スコア(IDF1)、検出性能と関連付け精度の両方をバランスよく評価する高次追跡精度(HOTA)などがあります。
軌道予測を理解する#
物体を複数のフレームにわたって追跡した後、次のステップではその物体が次にどこへ向かうかを予測します。これは軌道予測と呼ばれます。検出が物体を見つけ、追跡がその動きを追うのに対し、予測は先の状況を見通して将来の位置を推定します。
検出と追跡から得られる情報、例えば物体のバウンディングボックス、フレーム間の位置、割り当てられたIDなどを使用して、速度、方向、移動パターンといった動きの特徴量を計算できます。これらの派生情報により、予測モデルは物体が数秒後にどこにいる可能性が高いかを推定するために必要なデータを得られます。
追跡データに欠落や急激なジャンプが含まれる場合、補間手法によって、より滑らかで一貫性のある軌道を再構成できます。これにより、予測モデルはノイズの多い不完全な位置データではなく、高品質な動きの入力を受け取れます。

図3. 車の軌道予測の可視化。(出典)
こうした予測を行うため、多くのシステムは物体の動きが時間とともにどのように変化するかを理解するよう設計されたディープラーニングモデルに依存しています。過去の位置の系列と、そこから導出された動きの特徴を分析することで、これらのモデルは一般的な移動パターンを学習し、その知識を使って将来の経路を予測します。
ここでは、軌道予測でよく使用されるディープラーニングおよび機械学習のアプローチをいくつか紹介します。
-
Recurrent Neural Networks (RNNs): RNNsは、ビデオフレームの系列など、シーケンスを処理するよう設計されたディープラーニングモデルです。過去の位置を記憶し、その情報を使って物体がどのように移動してきたかを理解できます。これにより、加速、減速、直線移動といった単純な動きのパターンをシステムが認識できます。
-
Long Short-Term Memory Networks (LSTMs): LSTMsは、より長い期間にわたって情報を記憶できる、RNNのより高度なタイプです。これにより、曲がろうとしている車両や方向を変える歩行者など、より複雑な動きを捉えられます。より長期的な傾向を追跡できるため、混雑した環境でもより信頼性の高い予測を生成することが多くなります。
-
Transformers: Transformerは動きの系列全体を処理し、アテンションを使って系列の中で最も重要な詳細に焦点を当てます。そのため、合流する車や道路を横断する歩行者など、複数の物体が相互作用するシーンで特に効果を発揮します。
これらのモデルは、短期および長期の経路を予測できます。通常2秒未満の短期予測は最も正確になる傾向があります。一方、2~6秒などのより長い時間範囲の予測は、より先の状況を見通せますが、不確実性も大きくなります。
すべてを統合する:衝突検出アルゴリズム#
最終段階である衝突予測では、システムがこれまでに学習したすべての情報、つまり各物体が何であるか(検出)、どのように移動してきたか(追跡)、次にどこへ向かう可能性が高いか(予測)を使用します。このステップでは、予測された経路が衝突につながる形で交差する可能性があるかどうかを確認します。

図4. 衝突予測システムの仕組み(出典)
自動運転車の場合、衝突チェックシステムは、車、歩行者、自転車など、周囲の物体の将来の軌道を比較します。2つの予測経路が重なったり、危険なほど近づいたりすると、その状況を車両衝突の可能性として記録します。衝突リスクがどの程度差し迫っているかを把握するため、システムはタイム・トゥ・コリジョンと呼ばれる値も計算します。
タイム・トゥ・コリジョン(TTC)は、動きの速い環境における重要な測定値です。2つの物体が現在の速度と方向を維持した場合に衝突するまで、どの程度の時間が残っているかを推定します。TTCが一定のしきい値を下回ると、システムは警告の発出、ブレーキの作動、計画経路の調整などで対応できます。
衝突予測の実世界での応用#
衝突予測は、交通管理、スマートシティインフラ、産業オートメーション、モバイルロボティクスなど、多くの業界で不可欠になりつつあります。最先端のコンピュータービジョンモデルや予測モデルが進化し続ける中、これらのシステムは動きを予測する能力を高めています。
衝突予測と軌道予測の仕組みをより深く理解できたところで、これらの手法をさまざまな実世界の環境で活用できることを示す、興味深い研究事例を見ていきましょう。
YOLOを活用した緊急自動運転車両の衝突予測#
混雑して予測しにくい環境を走行することは、自律システムにとって最も難しい課題の一つです。特に、歩行者が明確なパターンに従わずに移動する場合は困難になります。緊急車両は、整備された道路、車線標示、予測可能な歩行者行動に頼ることなく、密集した公共空間を高速で迅速に移動する必要があるため、この問題に直面する機会がさらに多くなります。
このようなシナリオでは、人がどこにいて、次の数秒間にどのように移動する可能性があるかを理解することが、事故回避に不可欠です。例えば、最近のある研究では、歩行者の多い環境で稼働する緊急自動運転車両(EAV)向けに、完全な衝突予測パイプラインを構築することで、この課題を検討しました。
YOLOを活用した衝突予測パイプラインの仕組み#
この手法の仕組みを簡単に見てみましょう。
- YOLOによる歩行者検出: YOLOベースの検出器が各カメラフレーム内の歩行者を特定し、視認できる各人物のバウンディングボックスを出力します。
- ByteTrackによる動きの追跡: ByteTrackアルゴリズムがフレーム間でこれらの検出結果を関連付け、各歩行者に一貫したIDを付与します。これにより、歩行者が時間の経過とともにどのように移動しているかを示す動きの履歴が作成されます。
- 実世界の位置推定: 逆透視変換(IPM)によって2Dピクセル座標をおおよその地面平面上の位置に変換し、車両を基準とした実世界の空間内で歩行者がどこにいるかをシステムが理解できるようにします。
- cGANによる鳥瞰ビューの生成: 条件付きGANは、1つの画像形式を別の形式に変換するAIモデルです。これを使ってシーンの鳥瞰ビュー表現を作成します。この俯瞰レイアウトにより、歩行者の位置と周囲の状況を解釈しやすくなります。
- LSTMモデルによる軌道予測: 各歩行者の過去の位置と移動パターンを使用して、LSTMモデルが次の数秒間に移動する可能性の高い位置を予測します。
- 衝突円錐による効率的な衝突検出: 予測された軌道を衝突円錐法で比較し、車両と歩行者の経路が交差する進路にあるかどうかを判定します。
- 信号による衝突回避: システムが衝突を予測すると、最適なタイミングで聴覚信号(クラクションやベルなど)を作動させます。タイミングは歩行者の行動に影響を与え、速度を上げたり落としたりして安全な場所へ移動する機会を与えられるように選択されます。
エッジビジョンとYOLOによる都市での歩行者の安全確保#
同様に、衝突防止への別のアプローチでは、車両の先に目を向け、インフラ自体に焦点を当てます。車内のセンサーに依存する代わりに、この手法では横断歩道や交差点に設置したスマートカメラを使用して、歩行者と車両の動きをリアルタイムで監視します。こうした場所では予測が難しいことが多く、人が突然道路に出たり、自転車が交通の間を縫うように走行したり、ドライバーが必ずしも減速しなかったりするため、リスクを早期に検出することが重要です。
ある興味深い研究では、交差点で車両と歩行者のリスクを直接予測するよう設計されたエッジビジョンデバイス、NAVIBoxと呼ばれるシステムによって、この考え方を検討しました。このシステムはUltralytics YOLOv8モデルを使用して歩行者と車両を検出し、軽量なCentroidトラッカーでフレーム間の追跡を行います。これにより短く信頼性の高い動きの履歴を作成し、その後、斜めから撮影されたCCTV映像を、道路をより明確に示す鳥瞰レイアウトへ変換する透視変換によって補正します。
こうして補正された軌道を使い、NAVIBoxは道路利用者が次の数秒間にどのように移動する可能性があるかを推定し、経路が交差する可能性(交差判定とも呼ばれます)を確認できます。システムが危険な相互作用を検知すると、リモートサーバーやネットワーク接続に依存せず、ドライバー向けのディスプレイと歩行者向けのスピーカーを通じて直ちに警告を発します。実際の都市環境でのテストでは、NAVIBoxが真のリアルタイム応答に十分な速度で動作し、潜在的な衝突シナリオを正確に特定できることが示されました。これにより、混雑した都市交差点向けの実用的な安全ツールとなっています。

図5. 車両と歩行者の衝突リスクの予測。(出典)
衝突検出と衝突予測のメリットとデメリット#
AIを活用した予測衝突システムの利点をいくつか紹介します。
-
状況認識の向上: AIシステムは環境内で物体がどのように移動するかを継続的にマッピングし、大規模な人流、交通行動、機械の経路をより詳細に把握できるようにします。
-
長期計画に向けたデータに基づく洞察: 検出結果、ニアミス、移動パターンを記録することで、AIシステムは都市計画担当者、安全チーム、フリート運用者が交差点の再設計、標識の改善、運用ポリシーの改良に活用できる分析情報を提供します。
-
費用対効果の高いリスク防止: リスクが深刻化する前に検出することで、こうしたシステムは高額な事故、保険請求、機器修理を回避しやすくします。
メリットがある一方で、衝突のないシステムにも一定の限界があります。考慮すべき課題をいくつか紹介します。
- センサーとカメラの配置に関する制約: カメラの位置や角度が不適切だと、物体の大きさや距離が歪み、深度推定と軌道予測の信頼性が低下する可能性があります。
- オクルージョン: 物体が別の物体の背後に部分的または完全に隠れることがあります。その場合、モデルが視覚的な連続性を失うため、物体追跡が困難になります。
- 環境条件: 低照度、強い日差し、雨、霧、カメラ品質の低さなどにより、モデルがシーンを明瞭に捉える能力が低下し、精度に影響する可能性があります。
主なポイント#
衝突予測は、2つの強力な能力を組み合わせます。コンピュータービジョンはシステムが現在の環境で何が起きているかを理解できるようにし、軌道予測は次に起こる可能性が高いことの予測を支援します。
これらの強みを組み合わせることで、機械は動いている物体をリアルタイムで検出し、数秒先にそれらの物体がどのように相互作用する可能性があるかを予測できます。コンピュータービジョンと予測技術が進化し続ける中、衝突予測は、より安全で信頼性が高く、スケーラブルな自律システムの構築における重要な要素になると考えられます。
AIについて詳しく知るには、コミュニティとGitHubリポジトリをご覧ください。ソリューションページでは、ヘルスケアにおけるAIや製造業におけるコンピュータビジョンなどの活用例をご覧いただけます。ライセンスオプションを確認して、今すぐ開発を始めましょう。









