Ultralytics YOLO26がNMSを廃止する理由とデプロイメントへの影響
Ultralytics YOLO26が真のエンドツーエンドかつNMS不要の推論を実現する方法と、後処理の削除によってエクスポートとエッジデプロイメントが簡素化される理由をご紹介します。

1月14日、コンピュータビジョンモデルの最新世代であるUltralytics YOLO26をリリースしました。YOLO26で目指したのは、精度や速度を向上させることだけではなく、実世界のシステムで物体検出モデルをどのように構築し、デプロイするかを見直すことでした。
コンピュータビジョンが研究から本番環境へ移行するにつれ、モデルにはCPU、エッジデバイス、カメラ、ロボット、組み込みハードウェアで実行できることがますます求められています。こうした環境では、パフォーマンスと同じくらい、信頼性、低レイテンシ、デプロイの容易さが重要です。
Ultralytics YOLO26はこの現実を踏まえて設計されており、推論パイプラインから不要な複雑さを取り除く、合理化されたエンドツーエンドアーキテクチャを採用しています。YOLO26における最も重要なイノベーションの一つは、非最大抑制(一般にNMSと呼ばれます)の削除です。
長年にわたり、NMSは物体検出システムの標準的な構成要素として、重複する検出結果を整理する後処理ステップに使われてきました。効果的である一方、特にエッジハードウェアでは、追加の計算処理とデプロイ上の課題も生じていました。
YOLO26では、異なるアプローチを採用しました。予測の生成方法と学習方法を見直すことで、真のエンドツーエンドかつNMSフリーの推論を実現します。モデルは外部の整理ステップや手作業で作成したルールに依存せず、最終的な検出結果を直接生成します。これにより、YOLO26は高速になり、エクスポートが容易になり、幅広いハードウェアプラットフォームへより信頼性高くデプロイできます。

図1. Ultralytics YOLO26を使用した画像内の物体検出。
この記事では、従来の物体検出がNMSに依存していた理由、NMSがデプロイのボトルネックになった経緯、そしてUltralytics YOLO26が回避策を不要にする方法について詳しく説明します。早速始めましょう。
従来の物体検出では重複する検出結果が生成される#
NMSとは何か、そしてUltralytics YOLO26でなぜNMSを削除したのかを詳しく説明する前に、まず一歩戻り、従来の物体検出モデルがどのように予測を生成するかを見てみましょう。
従来の物体検出モデルでは、同じ物体に対して重複する複数のバウンディングボックスが生成されることがよくあります。これらのボックスはすべて画像内の同じ物体を指しているにもかかわらず、それぞれに独自の信頼度スコアが付与されます。
これにはいくつかの理由があります。まず、モデルは多数の空間位置と異なるスケールで、同時に予測を行います。これにより、さまざまなサイズの物体を検出できますが、近接する複数の位置が同じ物体をそれぞれ独立して識別する可能性も生じます。
次に、多くの物体検出システムではアンカーベースのアプローチを使用し、各位置の周囲に多数の候補ボックスを生成します。これにより物体を正確に見つけられる可能性は高まりますが、重複する予測の数も増加します。
最後に、グリッドベースの検出自体が、自然に冗長性を生み出します。物体が複数のグリッドセルの境界付近にある場合、複数のセルがその物体のボックスを予測し、重複する検出結果が複数生成されることがあります。
このため、モデルの未処理出力には、1つの物体に対して複数のボックスが含まれることがよくあります。結果を利用可能なものにするには、これらの冗長な予測をフィルタリングし、最終的な検出結果を1つだけ残す必要があります。
非最大抑制について#
物体検出モデルが同じ物体に対して重複する複数のバウンディングボックスを生成した場合、その結果は使用する前に整理する必要があります。ここで非最大抑制が適用されます。
非最大抑制は、モデルが予測を完了した後に実行される後処理ステップです。その目的は重複する検出結果を減らし、各物体を最終的なバウンディングボックス1つで表現することです。

図2. NMSの概要。画像:著者。
この処理では、信頼度スコアと重なりの大きさに基づいてバウンディングボックスを比較します。信頼度が非常に低い予測は、最初に削除されます。
次に、残ったボックスを信頼度順に並べ、最も高いスコアのボックスを最適な検出結果として選択します。選択されたボックスは、他のボックスと比較されます。
別のボックスとの重なりが大きすぎる場合、そのボックスは抑制され、削除されます。重なりは通常、Intersection over Unionを使用して測定します。これは、2つのボックスが共有する面積と、両方が占める総面積の比率を計算する指標です。この処理を、信頼度が最も高く重複していない検出結果だけが残るまで繰り返します。
NMSがデプロイを複雑にする理由#
非最大抑制は重複する検出結果のフィルタリングに役立ちますが、モデルが研究環境を離れて実世界にデプロイされると、課題がより顕著になります。
最大の課題の一つはパフォーマンスです。NMSは推論後に実行され、保持するボックスを決定するためにバウンディングボックス同士を比較する必要があります。
この処理は計算コストが高く、効率的な並列化も困難です。エッジデバイスやCPUベースのシステムでは、この追加処理によって無視できないレイテンシが発生し、リアルタイム要件への対応が難しくなる場合があります。
NMSはデプロイの複雑さも増大させます。NMSはモデル自体の一部ではないため、後処理コードとして別途実装する必要があります。
ランタイムやプラットフォームによってNMSの処理方法は異なるため、通常は対象環境ごとにカスタム実装を維持する必要があります。ある構成で動作するものが別の構成ではわずかに異なる挙動を示すことがあり、デプロイの信頼性が低下し、スケーリングも難しくなります。
ハードウェア最適化も別の課題です。NMSは、ニューラルネットワーク演算を効率的に実行するよう設計された専用AIアクセラレータに適切にマッピングできません。その結果、最適化されたハードウェア上でモデルが高速に実行されても、NMSがボトルネックとなり、全体のパフォーマンスが制限される可能性があります。
これらに加えて、NMSは信頼度しきい値や重複しきい値など、手動で選択したパラメータに依存します。これらの設定は結果に大きく影響する可能性があり、異なるデータセット、アプリケーション、ハードウェアに合わせて調整が必要になることもよくあります。そのため、本番システムでの挙動が予測しにくくなり、追加の設定負荷も生じます。
エンドツーエンド物体検出の推論を解説#
非最大抑制の制限を受け、物体検出モデルが推論時にどのように動作すべきかを見直すことになりました。多数の重複する予測を生成して後から整理するのではなく、より根本的な問いを立てました。
モデルが最終的な検出結果を直接生成できるとしたらどうでしょうか。この問いは、エンドツーエンド物体検出推論の中核にあります。エンドツーエンドシステムでは、外部の整理ステップに依存せず、開始から終了まで検出プロセス全体を処理できるようにモデルを学習します。
多数の候補ボックスを生成して推論後にフィルタリングするのではなく、モデル自体が少数の信頼度の高い、重複しない予測を生成できるように学習します。重複する検出結果は後処理で削除するのではなく、ネットワーク内部で解決されます。
新しいモデルアーキテクチャにより、このアプローチが可能かつ実用的であることが示されました。適切な学習戦略を用いれば、モデルは多数の競合する予測ではなく、各物体を1つの予測に関連付けることを学習でき、冗長性をその発生源で削減できます。

図3. Ultralytics YOLO26を使用した物体検出の例。
これを実現するには、学習方法も変える必要があります。多数の予測を同じ物体に対して競合させるのではなく、モデルは明確な1つの判断を下すように学習し、より少数で信頼度の高い検出結果を生成します。
全体として、よりシンプルな推論パイプラインになります。重複はすでに内部で解決されているため、推論時に非最大抑制を使用する必要はありません。モデル出力はすでに最終的な検出結果の集合になっています。
このエンドツーエンド設計により、デプロイも容易になります。後処理ステップやプラットフォーム固有のNMS実装がないため、エクスポートされたモデルは完全に自己完結しており、異なる推論フレームワークやハードウェア対象間で一貫して動作します。
Lead Partnership EngineerのFrancesco Mattioliは、「真のエンドツーエンド学習とは、微分可能性を損ないデプロイを複雑にする手作業の後処理ステップに依存せず、モデルがピクセルから予測までのすべてを処理することを意味します」と説明しています。
Ultralytics YOLO26がNMSを削除する方法#
Ultralytics YOLO26は、後処理で検出結果を整理するのではなく、検出結果の学習方法と生成方法を変更することで、非最大抑制を削除しています。同じ物体に対して多数の予測を競合させるのではなく、YOLO26は物体と出力の間に明確な1対1の関係を学習するようトレーニングされています。
これは、学習可能なクエリベース検出によって部分的に実現されています。この手法により、モデルは多数の重複する候補ではなく、各物体に対して信頼度の高い単一の予測を生成することに集中できます。各物体が1つの予測に関連付けられるため、重複する検出結果が自然に減少します。
この挙動は、学習中に一貫したマッチング戦略を用いることで強化されます。これにより、モデルは重複する予測を生成するのではなく、物体ごとに信頼度の高い1つの判断を下すよう促されます。最終的に、モデルが生成する予測数は少なくなりますが、それぞれが最終的な検出結果を表します。
DFLを削除することでNMSフリー検出が可能になった理由#
Ultralytics YOLO26でNMSフリー推論を可能にするもう一つの重要なイノベーションは、分布フォーカル損失(DFL)の削除です。以前のYOLOモデルでは、DFLは単一の値ではなく、ボックス位置の可能な分布を予測することで、バウンディングボックス回帰の精度向上に使われていました。
このアプローチにより位置特定の精度は向上しましたが、検出パイプラインの複雑さも増しました。真のエンドツーエンド推論へ移行する際、この複雑さが制限要因となりました。
DFLは追加の計算処理と固定された回帰範囲を導入するため、モデルが明確な1対1の物体割り当てを学習することが難しくなり、非最大抑制のような後処理ステップへの依存も高まりました。Ultralytics YOLO26では、DFLを削除し、バウンディングボックス回帰をよりシンプルで直接的なものに再設計しました。
分布ベースの出力に依存する代わりに、モデルは、より少数で信頼度の高い検出結果を実現する方法で、正確なボックス座標を予測するよう学習します。この変更により、重複する予測を発生源で削減し、バウンディングボックス回帰をUltralytics YOLO26のエンドツーエンドかつNMSフリーの設計に適合させることができます。
Ultralytics YOLO26はNMSフリーでデプロイが容易です#
NMSフリー設計により、Ultralytics YOLO26は真のエンドツーエンドモデルになります。これはモデルのエクスポートに重要な影響を与えます。
エクスポートとは、学習環境の外部で実行できる形式(ONNX、TensorRT、CoreML、OpenVINOなど)に、学習済みモデルを変換することです。従来のパイプラインでは、非最大抑制がモデル自体の一部ではないため、このプロセスがうまくいかないことがよくあります。
NMSを削除することで、Ultralytics YOLO26はこの問題を完全に回避できます。エクスポートされたモデルには、最終的な検出結果を生成するために必要なすべてがすでに含まれています。
これにより、エクスポートされたモデルは完全に自己完結し、推論フレームワークやハードウェア対象間でより高いポータビリティを実現します。同じモデルが、サーバー、CPUのみのシステム、組み込みデバイス、エッジアクセラレータのいずれにデプロイされても、一貫して動作します。エクスポートしたものをそのまま実行できるため、デプロイがよりシンプルになります。
このシンプルさは、エッジアプリケーションにおいて特に重要です。たとえば、YOLO26はドローンなどのデバイスに容易にデプロイでき、作物のモニタリング、圃場の検査、植物の健康状態の分析などに利用できます。こうした用途では、限られた計算資源と電力予算のため、複雑な後処理パイプラインは現実的ではありません。モデルが最終的な検出結果を直接出力するため、追加の処理ステップなしで軽量なハードウェア上でも安定して動作します。

図4. Ultralytics YOLO26は、ドローンなどのエッジデバイスに容易にデプロイできます。
つまり、NMSフリー推論によりエクスポートとデプロイの障壁が取り除かれ、よりクリーンで信頼性の高いビジョンシステムを実現できます。NMSは回避策でした。Ultralytics YOLO26では、もはや回避策は必要ありません。
主なポイント#
Ultralytics YOLO26は、重複する検出結果を後から整理するのではなく、その根本的な問題を解決することで非最大抑制を削除しています。エンドツーエンド設計により、モデルは最終的な検出結果を直接生成できるため、異なるハードウェア間でエクスポートとデプロイをよりシンプルかつ一貫したものにできます。NMSは以前のシステムにとって有用な回避策でしたが、YOLO26ではもはや必要ありません。
コミュニティに参加し、GitHubリポジトリを確認して、AIについて詳しく学びましょう。農業におけるAIと小売業におけるコンピュータビジョンのソリューションページもご覧ください。ライセンスオプションを確認して、今すぐビジョンAIを始めましょう。









