2025年の物体検出を深掘りするガイド
物体検出とそのAIにおける重要性、そしてYOLO11などのモデルが自動運転車、医療、セキュリティなどの業界を変革する方法を解説します。

多くの業界で、人工知能(AI)ソリューションが業務に急速に導入されています。現在利用できる数多くのAI技術の中でも、コンピュータビジョンは特に人気があります。コンピュータビジョンは、コンピュータが人間と同じように画像や動画の内容を見て理解できるようにするAIの一分野です。これにより、機械は物体を認識し、パターンを特定し、見ているものを理解できるようになります。
コンピュータビジョンの世界市場価値は、2032年までに1,757億2,000万ドルに成長すると推定されています。コンピュータビジョンには、ビジョンAIシステムが視覚データを分析・解釈できるようにするさまざまなタスクが含まれます。コンピュータビジョンで最も広く利用されている重要なタスクの一つが、物体検出です。
物体検出は、視覚データ内の物体の位置を特定し、分類することに重点を置いています。例えば、牛の画像をコンピュータに見せると、牛を検出してその周囲にバウンディングボックスを描画できます。この機能は、動物のモニタリング、自動運転車、監視など、実世界の用途で役立ちます。
では、物体検出はどのように実行できるのでしょうか。その方法の一つが、コンピュータビジョンモデルを利用することです。例えば、Ultralytics YOLO11は、物体検出などのコンピュータビジョンタスクをサポートするコンピュータビジョンモデルです。
このガイドでは、物体検出とその仕組みについて説明します。また、物体検出とUltralytics YOLO11の実世界における用途についても取り上げます。

図1 YOLO11の物体検出機能を使用した牛のモニタリング。
物体検出とは何ですか?#
物体検出は、画像や動画内の物体を特定して位置を検出するコンピュータビジョンタスクです。これは、「画像内にはどのような物体があるか」と「それらはどこにあるか」という2つの重要な問いに答えます。
物体検出は、2つの重要なステップから成るプロセスだと考えることができます。1つ目の物体分類では、学習したパターンに基づいて、猫、車、人などの物体を認識してラベル付けします。2つ目の位置特定では、物体の周囲にバウンディングボックスを描画して位置を特定し、画像内のどこに現れているかを示します。これらのステップを組み合わせることで、機械はシーン内の物体を検出して理解できるようになります。
物体検出を特徴づけているのは、物体を認識し、その位置を正確に特定できる点です。その他のコンピュータビジョンタスクは、異なる目的に焦点を当てています。
例えば、画像分類は画像全体にラベルを割り当てます。一方、画像セグメンテーションは、さまざまな要素をピクセルレベルで理解します。これに対して、物体検出は認識と位置特定を組み合わせます。そのため、複数の物体をリアルタイムでカウントするようなタスクに特に適しています。

図2 コンピュータビジョンタスクの比較。
物体認識と物体検出の比較#
さまざまなコンピュータビジョン用語を調べていると、物体認識と物体検出は互換的に使えるように感じるかもしれませんが、両者の目的は異なります。その違いを理解するには、顔検出と顔認識を比較するのがよい方法です。
顔検出は物体検出の一種です。画像内に顔が存在することを特定し、バウンディングボックスを使ってその位置を示します。これは「画像内の顔はどこにあるか」という問いに答えます。この技術は、顔に自動的に焦点を合わせるスマートフォンのカメラや、人が存在することを検出するセキュリティカメラなどで一般的に利用されています。
一方、顔認識は物体認識の一形態です。顔を検出するだけでなく、固有の特徴を分析してデータベースと比較することで、その顔が誰のものかを特定します。これは「この人物は誰か」という問いに答えます。Face IDによるスマートフォンのロック解除や、本人確認を行う空港のセキュリティシステムなどに利用されている技術です。
簡単に言えば、物体検出は物体を見つけて位置を特定し、物体認識は物体を分類して識別します。

図3. 物体検出と物体認識の比較。画像:著者。
Ultralytics YOLO11など、多くの物体検出モデルは顔検出をサポートするように設計されていますが、顔認識には対応していません。YOLO11は画像内の顔の存在を効率的に特定し、その周囲にバウンディングボックスを描画できるため、監視システム、群衆モニタリング、自動写真タグ付けなどの用途に役立ちます。ただし、その顔が誰のものかを判定することはできません。YOLO11は、FacenetやDeepFaceなど、顔認識用に特別に学習されたモデルと統合することで、単一のシステム上で検出と識別の両方を実現できます。
物体検出の仕組みを理解する#
物体検出の仕組みを説明する前に、まずコンピュータが画像をどのように分析するかを詳しく見てみましょう。コンピュータは私たちのように画像を見るのではなく、画像をピクセルと呼ばれる小さな正方形のグリッドに分解します。各ピクセルには、コンピュータが視覚データを解釈するために処理できる色と明るさの情報が含まれています。
これらのピクセルを理解するために、アルゴリズムは形状、色、互いの距離に基づいてピクセルを意味のある領域にグループ化します。Ultralytics YOLO11などの物体検出モデルは、これらのピクセルグループ内のパターンや特徴を認識できます。
例えば、自動運転車は私たちと同じように歩行者を見るのではなく、歩行者の特徴に一致する形状やパターンを検出します。これらのモデルは、ラベル付きの画像データセットを使った大規模な学習に依存しており、車、交通標識、人などの物体の特徴的な特性を学習できます。
一般的な物体検出モデルは、バックボーン、ネック、ヘッドという3つの主要部分で構成されています。バックボーンは画像から重要な特徴を抽出します。ネックはこれらの特徴を処理して洗練し、ヘッドは物体の位置を予測して分類します。
検出結果の改善と表示#
初期検出が完了すると、精度を向上させ、重複する予測を除外するために、後処理技術が適用されます。例えば、重なり合うバウンディングボックスを削除し、最も関連性の高い検出結果だけを残します。また、検出された物体が特定のクラスに属するとモデルがどの程度確信しているかを表す数値である信頼度スコアを各検出物体に割り当て、予測に対するモデルの確信度を示します。
最後に、検出された物体の周囲にバウンディングボックスを描画し、予測されたクラスラベルと信頼度スコアを添えて出力を表示します。これらの結果は、実世界の用途に利用できます。
代表的な物体検出モデル#
現在、利用できるコンピュータビジョンモデルは数多くあり、その中でも特に人気が高いのがUltralytics YOLOモデルです。これらは速度、精度、汎用性で知られています。長年にわたり、これらのモデルは高速化・高精度化され、より幅広いタスクに対応できるようになりました。Ultralytics YOLOv5のリリースにより、PyTorchなどのフレームワークを使ったデプロイが容易になり、高度なビジョンAIを深い技術的専門知識なしで利用できる人が増えました。
この基盤を発展させたUltralytics YOLOv8では、インスタンスセグメンテーション、ポーズ推定、画像分類などの新機能が導入されました。現在、YOLO11は複数のタスクでより優れたパフォーマンスを発揮し、さらに進化しています。YOLOv8mよりパラメータ数が22%少ないYOLO11mは、COCOデータセット上でより高い平均適合率(mAP)を達成します。簡単に言えば、YOLO11はより少ないリソースで物体を高精度に認識できるため、より高速で信頼性の高いモデルです。
AIの専門家でも、これから始める方でも、Ultralytics YOLO11はコンピュータビジョンアプリケーション向けの高性能で使いやすいソリューションを提供します。
物体検出向けのモデルのカスタム学習#
ビジョンAIモデルの学習では、コンピュータが画像や動画を認識して理解できるようにします。ただし、学習には時間がかかる場合があります。ゼロから始める代わりに、転移学習を利用すると、一般的なパターンをすでに認識できる事前学習済みモデルを使って作業を高速化できます。
例えば、Ultralytics YOLO11は、日常的な物体を多様に含むCOCOデータセットで学習済みです。この事前学習済みモデルに追加でカスタム学習を行うことで、元のデータセットに含まれていない特定の物体を検出できるようになります。
Ultralytics YOLO11をカスタム学習するには、検出したい物体の画像を含むラベル付きデータセットが必要です。例えば、食料品店にあるさまざまな種類の果物を識別するモデルを構築したい場合は、リンゴ、バナナ、オレンジなどのラベル付き画像でデータセットを作成します。データセットの準備ができたら、バッチサイズ、学習率、エポック数などのパラメータを調整してYOLO11を学習し、パフォーマンスを最適化できます。
このアプローチにより、企業は製造現場の欠陥部品から保全プロジェクトの野生動物種まで、目的に合わせてUltralytics YOLO11を学習させ、必要なものを正確に検出できるようになります。
物体検出の用途#
次に、物体検出の実世界におけるユースケースと、それがさまざまな業界をどのように変革しているかを見てみましょう。
自動運転における危険検出#
自動運転車は、物体検出などのコンピュータビジョンタスクを使って安全に走行し、障害物を回避します。この技術により、歩行者、他の車両、道路のくぼみ、道路上の危険を認識でき、周囲の状況をより正確に把握できます。環境を常に分析することで、迅速な判断を下し、交通の中を安全に移動できます。

図4 Ultralytics YOLO11で物体検出を使用して道路のくぼみを検出する例。
ヘルスケアにおける医用画像分析#
医用画像技術であるX線、MRI、CTスキャン、超音波検査は、病気の診断や治療に役立つ、人体の非常に詳細な画像を作成します。これらのスキャンでは大量のデータが生成されるため、放射線科医や病理医などの医師は病気を検出するために慎重に分析する必要があります。しかし、すべての画像を詳細に確認するには時間がかかり、疲労や時間的制約によって人間の専門家が細部を見落とすこともあります。
Ultralytics YOLO11などの物体検出モデルは、臓器、腫瘍、異常など、医用スキャン内の重要な特徴を高精度で自動的に特定することで支援できます。カスタム学習したモデルは、バウンディングボックスで注意が必要な領域を示し、医師が潜在的な問題により迅速に集中できるようにします。これにより、作業負荷を軽減し、効率を高め、迅速な洞察を提供できます。

図5 Ultralytics YOLO11を使用した医用画像の分析。
人物検出と異常検出によるセキュリティの強化#
物体追跡はUltralytics YOLO11がサポートするコンピュータビジョンタスクであり、リアルタイムモニタリングとセキュリティ強化を可能にします。物体検出を基盤として、物体を特定し、フレーム間でその移動を継続的に追跡します。この技術は、さまざまな環境の安全性を高めるために監視システムで広く利用されています。
例えば、学校や託児施設では、物体追跡によって子どもを見守り、どこかへ迷い込むのを防止できます。セキュリティ用途では、立入制限区域への侵入者の検出、過密状態や不審な行動を把握するための群衆モニタリング、許可されていない活動を検出した際のリアルタイムアラートの送信において重要な役割を果たします。物体の移動を追跡することで、Ultralytics YOLO11を利用した追跡システムはセキュリティを強化し、モニタリングを自動化し、潜在的な脅威への迅速な対応を可能にします。
物体検出のメリットとデメリット#
物体検出がさまざまな業界にもたらす主なメリットは次のとおりです。
- 自動化: 物体検出は、CCTV映像の監視などのタスクで、人による監視の必要性を減らすのに役立ちます。
- 他のAIモデルとの連携: 顔認識、行動認識、追跡システムと統合することで、精度と機能性を向上させられます。
- リアルタイム処理: Ultralytics YOLO11など、多くの物体検出モデルは高速かつ効率的で、即時の結果が必要なリアルタイムアプリケーションに適しています。
これらのメリットから、物体検出がさまざまなユースケースに与える影響が分かりますが、実装に伴う課題も考慮することが重要です。主な課題は次のとおりです。
-
データプライバシー: 特に監視やヘルスケアなどの機微な領域で視覚データを利用すると、プライバシー問題やセキュリティ上の懸念が生じる可能性があります。
-
オクルージョン: 物体検出におけるオクルージョンは、物体が部分的に遮られたり視界から隠れたりすることで、モデルによる正確な検出と分類が難しくなる状態です。
-
計算コストが高い: 高性能モデルでは、処理に高性能なGPU(グラフィックス処理ユニット)が必要になることが多く、リアルタイムでのデプロイにはコストがかかります。
主なポイント#
物体検出は、画像や動画内の物体を機械が検出して位置を特定できるようにする、コンピュータビジョンにおける画期的なツールです。自動運転車からヘルスケアまで幅広い分野で利用され、タスクをより簡単、安全、効率的にしています。Ultralytics YOLO11などの新しいモデルを使えば、企業はカスタム物体検出モデルを容易に作成し、専門的なコンピュータビジョンアプリケーションを構築できます。
プライバシーへの懸念や物体が視界から隠れるといった課題はありますが、物体検出は信頼性の高い技術です。タスクの自動化、視覚データのリアルタイム処理、他のビジョンAIツールとの統合が可能であるため、最先端のイノベーションに不可欠な要素となっています。
詳しくは、GitHubリポジトリをご覧いただき、コミュニティにご参加ください。ソリューションページで、自動運転車におけるAIや農業におけるコンピュータビジョンなどの分野のイノベーションをご覧ください。YOLOのライセンスオプションも確認して、ビジョンAIプロジェクトを実現しましょう。🚀









