Ultralytics YOLO11による小物体検出を探る
Ultralytics YOLO11が、監視やロボティクスなどの実世界のアプリケーションで、高速かつ正確な小物体検出を実現する方法をご紹介します。

ビジョンAIを統合したドローンは地上数百メートルの高さを飛行しながら、映像内でわずか数ピクセルにしか見えない人物の検出まで求められることがあります。実際、これはロボティクス、監視、リモートセンシングなどのアプリケーションでよくある課題です。これらの分野では、画像内の非常に小さな物体をシステムで識別する必要があります。
しかし、従来の物体検出モデルでは、これが難しい場合があります。画像や動画内の小さな物体から得られる視覚情報は非常に限られています。簡単に言えば、モデルがそれらを見るとき、学習や認識に利用できる詳細がほとんどありません。
内部では、これらのモデルは通常、畳み込みニューラルネットワーク(CNN)ベースのアーキテクチャに依存しています。画像はネットワークの各層を通過し、元のピクセルではなく、関連するパターンを強調した特徴マップや簡略化された表現へと変換されます。
画像がネットワークのより深い層へ進むにつれて、これらの特徴マップは小さくなります。これにより計算は高速になりますが、細かなディテールが失われる可能性もあります。
小さな物体にとって、これらのディテールは非常に重要です。ディテールが失われると、コンピュータビジョンモデルは物体の検出に苦労し、不正確または一貫性のないバウンディングボックスにつながる可能性があります。
リアルタイムのエンドツーエンドコンピュータビジョンシステムでは、この問題はさらに難しくなります。高解像度の画像はディテールの保持に役立ちますが、推論速度が低下し、より多くのGPU性能が必要になります。低解像度では高速に処理できますが、小さな物体の検出はさらに困難になります。
速度、精度、ハードウェアの制約の間で、常にバランスを取る必要があります。近年の技術の進歩により、Ultralytics YOLO11や近日提供予定のUltralytics YOLO26などのコンピュータビジョンモデルは、このトレードオフをより効果的に管理できるよう設計されています。

図1. 航空画像内の小さな物体を検出するYOLO11(出典)
この記事では、小さな物体の検出が難しい理由と、Ultralytics YOLO11によってそれを容易にする方法を説明します。早速始めましょう。
小さな物体検出とは何か、なぜ重要なのか#
小さな物体検出は、AIの一分野であるコンピュータビジョンのタスクで、画像内の非常に小さな領域を占める物体の識別と位置特定に焦点を当てます。これらの物体は、デジタル画像の最小単位であるピクセルの数が限られた状態で画像内に表現されることが多く、より大きく明瞭な対象(通常はより多くのピクセルを含みます)よりも検出が困難です。
例えば、航空画像内の車両、工場の床にある工具、広角監視カメラで撮影された人物は、いずれも画像内で小さな物体として現れることがあります。これらの検出が重要なのは、重要な情報を含んでいることが多く、監視など多くの実世界のアプリケーションが、正しく機能するためにこの検出に依存しているためです。
小さな物体を見逃すと、システム性能や意思決定に影響が生じる可能性があります。無人航空機(UAV)による監視がその好例で、地上の小さな移動物体を見逃すと、ナビゲーションや追跡の精度に影響する場合があります。
小さな物体の検出に関する課題#
初期のシステムでは、手作業で設計した特徴量や従来のコンピュータビジョン手法が使われていましたが、複雑または多様なシーンでは問題が生じていました。現在でも、深層学習モデルの性能は大幅に向上しているものの、対象が画像のごく小さな部分しか占めない場合、小さな対象の検出は依然として困難です。
次に、さまざまな実世界のシナリオで小さな物体を検出する際に生じる、一般的な課題を見ていきましょう。
サイズ、ピクセル、情報損失#
小さな物体はピクセル数が非常に少ないため、特徴抽出などの段階でモデルが学習できる視覚的ディテールの量が制限されます。その結果、エッジ、形状、テクスチャなどのパターンを検出しにくくなり、小さな物体が背景に溶け込みやすくなります。
画像がニューラルネットワークの畳み込み層を通過すると、ピクセル内の視覚情報は徐々に特徴マップへ圧縮されます。これによりモデルは効率性を維持できますが、細かなディテールも失われていきます。

図2. 特徴マップは画像内の視覚パターンを表します(出典)
小さな対象では、検出ネットワークが処理する前に重要な手がかりが失われる可能性があります。そうなると、位置特定の信頼性が低下し、バウンディングボックスがずれたり、重なったり、対象物を完全に見逃したりすることがあります。
オクルージョン、スケールのばらつき、コンテキスト#
サイズに関する課題は、オクルージョンによって生じることもよくあります。オクルージョンとは、特に小さな物体が、シーン内の別の物体によって部分的に隠される現象です。
これにより対象の可視領域が狭まり、物体検出器が利用できる情報が制限されます。わずかなオクルージョンでも、特に低解像度の入力と組み合わさると、検出ネットワークを混乱させる可能性があります。興味深い例として、VisDroneなどのUAVデータセットが挙げられます。そこでは、歩行者、自転車、車両が建物、木、その他の移動物体によって部分的に遮られることがあります。

図3. 小さな物体を示すVisDroneデータセットの例(出典)
同様に、距離やカメラの位置によって同じ物体が非常に小さく見えたり、比較的大きく見えたりする場合、スケールのばらつきが新たな難しさをもたらします。こうした課題があるにもかかわらず、検出アルゴリズムは精度を失わずに、さまざまなスケールの小さな物体を認識する必要があります。
コンテキストも検出において重要な役割を果たします。例えば、大きな物体は通常、役立つ視覚的手がかりを与える明瞭な周囲の環境とともに現れます。一方、小さな対象にはこのようなコンテキスト情報が不足していることが多く、パターン認識が難しくなります。
小さな物体検出における隠れたメトリクスの問題#
Intersection over Union(IoU)などの一般的な評価メトリクスは、予測されたバウンディングボックスが正解ボックスとどの程度重なっているかを測定します。IoUは大きな物体には有効ですが、小さな物体では挙動が大きく異なります。
小さな物体は数ピクセルしか占めないため、予測ボックスのわずかなずれでも相対的に大きな誤差が生じ、IoUスコアが大幅に低下する可能性があります。そのため、物体が画像内に見えている場合でも、予測を正解として数えるために使用される標準的なIoUしきい値を、小さな物体では満たせないことがよくあります。
結果として、位置特定の誤りが偽陽性または偽陰性に分類される可能性が高くなります。こうした制約から、研究者は物体検出システムによる小さく検出困難な対象の評価方法や処理方法を見直すようになりました。
マルチスケール特徴量:リアルタイムの小さな物体検出の鍵#
研究者が小さな物体検出の改善に取り組む中で、複数のスケールにわたって視覚情報を保持し、表現することが不可欠であると明らかになりました。この知見は、近年のarXiv研究や、IEEE国際会議、欧州コンピュータビジョン協会(ECCV)などの場で発表された論文にも反映されています。
画像がニューラルネットワークのより深い層へ進むと、小さな物体はディテールを失ったり完全に消えたりする可能性があります。そのため、Ultralytics YOLO11などの最新のコンピュータビジョンモデルは、より優れた特徴抽出を重視しています。ここでは、特徴マップと特徴ピラミッドネットワークの基本概念を確認し、理解を深めます。
特徴マップとスケール表現#
リモートセンシング画像などの入力画像がニューラルネットワークに入ると、徐々に特徴マップへ変換されます。特徴マップは画像を簡略化した表現で、エッジ、形状、テクスチャなどの視覚パターンを強調します。
ネットワークが深くなるにつれて、これらの特徴マップは空間的なサイズが小さくなります。この縮小により、モデルは効率的に動作し、高レベルの情報に集中できます。しかし、特徴マップの縮小や深層化によって、空間的なディテールも減少します。

図4. 小さな物体検出では特徴抽出が重要です。(出典)
大きな物体は正確な検出に十分な視覚情報を保持しますが、小さな対象では、わずか数層のネットワークを通過しただけで重要なディテールが失われる可能性があります。そうなると、モデルは小さな物体が存在すること自体を認識しにくくなります。これが、深層物体検出モデルで小さな物体が見逃される主な理由の1つです。
特徴ピラミッドネットワークとマルチスケール学習#
特徴ピラミッドネットワーク(FPN)は、空間的ディテールの損失に対処するために導入されました。複数の層から情報を組み合わせる補助モジュールとして機能し、モデルが小さな物体をより効果的に検出できるようにします。この処理は、特徴量集約や特徴量融合とも呼ばれます。
浅い層は細かな空間的ディテールを提供し、深い層はセマンティックなコンテキストを加えるため、効果的なマルチスケール特徴学習が可能になります。特徴マップを単純に拡大するだけの単純なアップサンプリングとは異なり、FPNは意味のある情報を保持し、小さな物体検出を改善します。
最新の手法は、適応型の特徴量融合やコンテキスト対応設計を用いてこの考え方を発展させ、小さな対象の検出をさらに強化しています。つまり、FPNはモデルが全体像と小さなディテールを同時に捉えるのを助けます。物体が小さい場合、この最適化は不可欠です。
小さな物体に対応するための物体検出モデルの進化#
物体検出モデルが、非常に小さな物体を含むさまざまなサイズの物体をより適切に検出するため、時代とともにどのように進化・発展してきたかを簡単に見てみましょう。
- 初期の検出手法: 初期の物体検出手法は、古典的な画像処理に基づく手作業で設計された特徴量とルールベースのアルゴリズムに依存していました。これらの特徴量は固定されていたため、画像が変わると性能が低下しました。
- 機械学習と深層学習の導入: 機械学習と深層学習の採用は、物体検出研究に大きな転換をもたらしました。あらかじめ定義されたルールに依存する代わりに、ニューラルネットワークがトレーニングデータから視覚表現を直接学習し、さまざまな物体サイズやシーンへの適応性を向上させました。
- 畳み込みネットワーク: これらのニューラルネットワークは、画像内のパターンを捉えるように学習します。各層は異なるディテールを抽出し、単純なエッジや色から始まり、形状、そして最終的には物体全体へと進むため、最新のコンピュータビジョンに不可欠です。
- 2段階物体検出器: GirshickとRenが提案したFaster R-CNNなどの2段階検出器は、まず候補領域を生成し、その後に分類を行います。この手法は小さな物体の精度を向上させましたが、計算コストが増加し、リアルタイム性能が低下しました。
- 1段階物体検出器: SSD(単一ショット検出器)やYOLO(1回の推論で検出)ファミリーなどの1段階検出器は、YOLOv3、Ultralytics YOLOv5、後のUltralytics YOLOv8を含め、1回の処理で検出を実行します。この設計により、競争力のある精度を維持しながら推論速度が大幅に向上します。
- 最新の最先端モデル: より新しい物体検出モデルは、リアルタイム性能とエッジデプロイメントをより重視しています。Ultralytics YOLO11や近日提供予定のUltralytics YOLO26など、近年のUltralytics YOLOモデルのリリースは、高い精度と低レイテンシの推論のバランスを取るよう設計されており、計算能力に制約のあるデバイス上で、小さな対象を含むあらゆるサイズの物体を検出する用途に適しています。
小さな物体検出のユースケースでUltralytics YOLO11を使用する#
小さな物体検出の仕組みをより深く理解できたところで、Ultralytics YOLO11を適用できる実世界のアプリケーションをいくつか見てみましょう。
UAVと航空画像処理#
混雑した都市の通りのはるか上空を飛ぶドローンを想像してください。その高さから見ると、車、自転車、さらには人物までもが画面上でわずか数ピクセルに縮小されます。
UAVや航空画像処理のモジュールは、このようなシーンを撮影することがよくあります。そこでは関心対象が小さく、複雑な背景に囲まれているため、コンピュータビジョンモデルによる検出が困難です。
このようなシナリオでは、Ultralytics YOLO11が理想的なモデルの選択肢となる可能性があります。例えば、YOLO11のようなモデルを搭載したドローンは、シーン内を移動する車両、自転車利用者、歩行者を検出しながら、交通をリアルタイムで監視できます。各物体が画像のごく一部しか占めていない場合でも検出可能です。これにより、交通管理、公共安全、都市計画などのアプリケーションで、より迅速な意思決定と精度の高いインサイトが可能になります。
ロボティクスと自動化#
ロボットは、精度とタイミングが重要な環境でよく使用されます。倉庫、工場、農場などでは、組立ライン上の部品、パッケージのラベル、畑の小さな植物の芽など、非常に小さな物体を認識して迅速に対応する必要が生じる場合があります。
このサイズの物体の検出は、カメラ映像内でわずか数ピクセルにしか見えない場合や、他の物体によって部分的にオクルージョンが生じている場合に、特に複雑になります。こうした小さなディテールを見逃すと、自動化の速度が低下したり、ロボットのタスク完了能力に影響したりする可能性があります。
Ultralytics YOLO11は、このような状況で違いを生み出せます。改善された特徴抽出と高速な推論により、ロボットは小さな物体をリアルタイムで検出し、直ちに行動できます。
Ultralytics YOLO11はインスタンスセグメンテーションにも対応しており、一般的なバウンディングボックスの位置を特定するだけでなく、ロボットが物体の境界や把持点をより正確に理解するのに役立ちます。例えば、YOLO11と統合したロボットアームは、コンベアベルト上の小さな部品を見つけ、その正確な形状をセグメント化し、手の届かない場所へ移動する前に拾い上げることで、システムの効率性と信頼性の維持に貢献できます。
Ultralytics YOLO11が小さな物体検出に有効な理由#
現在利用できるコンピュータビジョンモデルが数多くある中で、Ultralytics YOLO11の際立った特徴は何かと疑問に思うかもしれません。
小さな物体の検出が必要なアプリケーションで、Ultralytics YOLO11が優れた選択肢となる理由をいくつか紹介します。
- より優れた特徴抽出:YOLO11は、改善されたバックボーンとネックのアーキテクチャを使用して特徴抽出を強化し、より精密な物体検出を可能にします。
- エコシステムと使いやすさ:Ultralytics Pythonパッケージは、YOLO11などのモデルの読み込み、トレーニング、検証、デプロイメントのための組み込み関数を提供するライブラリです。これらのワークフローに必要なコードは数行だけなので、チームは小さな物体検出用のモデルを迅速に試行し、ファインチューニングできます。
- エッジデプロイメント向けに最適化: Ultralytics YOLO11は、NVIDIA Jetson、Raspberry Pi、産業用カメラシステムなどのエッジデバイス上で効率的に動作します。簡単に言えば、デバイス上で直接リアルタイムのビジョンAIタスクを実行できます。
Ultralytics YOLO11で小さな物体を検出する際に使用できる実践的な戦略#
Ultralytics YOLO11のようなモデルを使用することに加え、アノテーションの準備方法、データセット全体の構成、モデルのトレーニング手順が、検出性能に大きな違いをもたらす可能性があります。
重点を置くべき点を簡単に紹介します。
- 適切なデータ拡張: スケーリングやクロッピングなどの軽度のデータ拡張は、モデルが新しい画像に一般化するのに役立ちます。ただし、大規模で過度なデータ拡張は小さな物体を歪めたり削除したりする可能性があり、モデルが学習しにくくなります。
- 失敗事例の確認: モデルが物体を見逃したり誤認識したりする箇所を分析すると、ベースラインを作成し、問題がデータセットに起因するのか、特徴抽出中の情報損失に起因するのか、トレーニング設定の調整が必要なのかを明らかにできます。
- データセットの構成: データセットには、モデルが意味のあるパターンを学習できるよう、小さな物体の例を十分に含める必要があります。また、トレーニング中に大きな物体が小さな物体を圧倒しないよう、バランスを保つ必要があります。
主なポイント#
小さな物体検出が難しいのは、画像がコンピュータビジョンモデルを通過する際に、小さな対象のディテールが失われるためです。Ultralytics YOLO11は、こうしたディテールの保持方法を改善し、リアルタイム性能を犠牲にすることなく、小さな物体検出の信頼性を高めます。このバランスにより、YOLO11は実世界のアプリケーションで正確かつ効率的な検出を支援できます。
成長を続けるコミュニティに参加しましょう。GitHubリポジトリを探索して、AIについてさらに学んでください。小売業におけるコンピュータビジョンや自動車業界におけるAIなどのイノベーションについては、ソリューションページをご覧ください。今日からコンピュータビジョンの構築を始めるには、ライセンスオプションをご確認ください。









