2025年の物体検出を深掘りするためのガイド
物体検出の基礎、AIにおけるその重要性、そしてYOLO11のようなモデルが自動運転車、ヘルスケア、セキュリティなどの業界をどのように変革しているかを学びます。

多くの業界が、人工知能(AI)ソリューションを急速に業務へ統合しています。現在利用可能な多数のAI技術の中でも、コンピュータービジョンはその中で最も人気のあるものの1つです。Computer visionは、人間と同様にコンピューターが画像や動画の内容を見て理解するのを助けるAIの分野です。これにより、機械がオブジェクトを認識し、パターンを識別し、見ているものを理解することが可能になります。
コンピュータービジョンのglobal market value of computer visionは、2032年までに1,757億2,000万ドルに成長すると推定されています。コンピュータービジョンには、ビジョンAIシステムが視覚データを分析および解釈できるようにするさまざまなタスクが含まれています。コンピュータービジョンの最も広く使用されている不可欠なタスクの1つがオブジェクト検出です。
Object detectionは、視覚データ内のオブジェクトのローカライズと分類に焦点を当てています。たとえば、コンピューターに牛の画像を表示すると、牛を検出し、その周囲にBBoxを描画できます。この機能は、動物のモニタリング、自動運転車、監視などの現実世界のアプリケーションで役立ちます。
では、オブジェクト検出はどのように実行されるのでしょうか。1つの方法は、コンピュータービジョンモデルを使用することです。たとえば、Ultralytics YOLO11は、オブジェクト検出などのコンピュータービジョンタスクをサポートするコンピュータービジョンモデルです。
本ガイドでは、物体検出とその仕組みについて詳しく探ります。また、物体検出とUltralytics YOLO11の実世界でのアプリケーションについても解説します。

Fig 1. YOLO11のオブジェクト検出サポートを使用して牛を監視します。
物体検出とは?#
物体検出は、画像や動画内の物体を特定して位置を特定するコンピュータビジョンタスクです。これは、「画像の中に何の物体があるか?」と「それらはどこにあるか?」という二つの重要な問いに答えるものです。
物体検出は二つの重要なステップを含むプロセスと考えると分かりやすいでしょう。最初のステップである物体分類では、学習済みのパターンに基づいて、猫、車、人などを識別しラベル付けすることでシステムが物体を認識します。二つ目のステップであるローカライゼーションでは、物体を囲むbboxを描画することで物体の位置を特定し、画像内のどこにそれが存在するかを示します。これらを組み合わせることで、機械はシーン内の物体を検出し理解できるようになります。
オブジェクト検出をユニークなものにしている側面は、オブジェクトを認識してその位置を正確に特定する能力です。他のcomputer vision tasksは、異なる目標に焦点を当てています。
例えば、画像分類は画像全体に対して一つのラベルを割り当てます。一方、画像セグメンテーションは、様々な要素をピクセル単位で理解します。対照的に、物体検出は認識とローカライゼーションを組み合わせたものです。このため、リアルタイムで複数の物体をカウントするようなタスクに特に役立ちます。

Fig 2. コンピュータービジョンタスクの比較。
物体認識と物体検出の違い#
コンピュータビジョンに関する様々な用語を調べていると、物体認識と物体検出は交換可能であるように感じるかもしれませんが、これらは異なる目的を持っています。その違いを理解するための良い方法は、顔検出と顔認識を比較することです。
顔検出は物体検出の一種です。画像内に顔が存在するかどうかを識別し、bboxを使用してその位置をマークします。これは「画像内のどこに顔があるか?」という問いに答えるものです。この技術は、カメラで自動的に顔にフォーカスを合わせるスマートフォンや、人の存在を検知するセキュリティカメラなどで一般的に使用されています。
一方、Face recognitionはオブジェクト認識の一形態です。単に顔を検出するだけでなく、固有の特徴を分析してデータベースと比較することで、誰の顔であるかを識別します。「この人は誰ですか?」という疑問に答えます。これは、Face IDによるスマートフォンのロック解除や、身元を確認する空港のセキュリティシステムの背後にある技術です。
簡潔に言えば、物体検出は物体を発見して位置を特定し、物体認識はそれらを分類して識別します。

図3:物体検出と物体認識の比較。画像提供:著者。
Ultralytics YOLO11 のような多くの物体検出モデルは、顔検出をサポートするように設計されていますが、顔認識はサポートしていません。YOLO11 は画像内の顔の存在を効率的に特定し、その周囲にバウンディングボックスを描画できるため、監視システム、群衆モニタリング、自動写真タグ付けなどのアプリケーションに役立ちます。ただし、それが誰の顔であるかを特定することはできません。YOLO11 を FaceNet や DeepFace などの顔認識専用にトレーニングされたモデルと統合することで、単一のシステムで検出と識体の両方を有効にすることができます。
オブジェクト検出の仕組みを理解する#
物体検出がどのように機能するかを議論する前に、まずコンピュータが画像をどのように分析するかを詳しく見ていきましょう。コンピュータは私たちが画像を見るのとは異なり、ピクセルと呼ばれる小さな四角形のグリッドに分解します。各ピクセルには色と明るさの情報が含まれており、コンピュータはこれを処理して視覚データを解釈します。
これらのピクセルを理解するために、アルゴリズムは形状、色、および互いの近接度に基づいてピクセルを意味のある領域にグループ化します。Ultralytics YOLO11などの物体検出モデルは、これらのピクセルグループ内のパターンや特徴を認識できます。
たとえば、自動運転車は私たちがするように歩行者を見るのではなく、歩行者の特徴に一致する形状やパターンを検出します。これらのモデルは、ラベル付けされたimage datasetsを使用した広範なトレーニングに依存しており、車、道路標識、人などのオブジェクトの独特な特徴を学習できるようになります。
典型的な物体検出モデルには、バックボーン、ネック、ヘッドという3つの主要なパーツがあります。バックボーンは画像から重要な特徴を抽出します。ネックはこれらの特徴を処理および洗練し、ヘッドは物体の位置を予測し、分類する役割を担います。
検出結果の洗練と提示#
初期の検出が行われた後、accuracyを向上させ、冗長な予測をフィルターで除外するために後処理技術が適用されます。たとえば、重なり合うバウンディングボックスが削除され、最も関連性の高い検出のみが保持されるようになります。また、検出された各オブジェクトには信頼度スコア(検出されたオブジェクトが特定のクラスに属するモデルの確信度を表す数値)が割り当てられ、予測におけるモデルの確実性を示します。
最終的に、検出された物体の周囲に描画されたbboxとともに、予測されたクラスラベルと信頼度スコアが出力として表示されます。これらの結果は、実世界のアプリケーションに使用されます。
一般的な物体検出モデル#
現在、多くのコンピュータービジョンモデルが利用可能であり、最も人気のあるもののいくつかはUltralytics YOLO modelsです。それらはスピード、精度、汎用性で知られています。長年にわたり、これらのモデルはより高速になり、より正確になり、より幅広いタスクを処理できるようになりました。Ultralytics YOLOv5のリリースにより、PyTorchなどのフレームワークでのデプロイが容易になり、より多くの人が深い技術的専門知識を必要とせずに高度なビジョンAIを使用できるようになりました。
この基盤の上に構築されたUltralytics YOLOv8は、インスタンスセグメンテーション、ポーズ推定、画像分類などの新機能を導入しました。現在、YOLO11は、複数のタスクにわたる優れたパフォーマンスにより、さらに進んだ進化を遂げています。YOLOv8mよりも22%少ないパラメータ数で、YOLO11mはCOCOデータセットでより高いmAPを実現します。簡単に言うと、YOLO11はより少ないリソースを使用しながらより高い精度でオブジェクトを認識できるため、より高速で信頼性が高くなります。
AIのエキスパートであっても、これから始める方であっても、Ultralytics YOLO11はコンピュータービジョンアプリケーションに向けて強力かつ使いやすいソリューションを提供します。
物体検出のためのカスタムトレーニング#
視覚AIモデルのトレーニングには、コンピュータが画像や動画を認識して理解できるように支援する作業が含まれます。しかし、トレーニングは時間のかかるプロセスになる可能性があります。ゼロから始めるのではなく、すでに一般的なパターンを認識している事前学習済みモデルを利用する「転移学習」を用いることで、プロセスを高速化できます。
例えば、Ultralytics YOLO11は、多様な日常のオブジェクトを含むCOCO datasetで既に学習済みです。この事前学習済みモデルは、元のデータセットに含まれていない特定のオブジェクトを検出するためにさらにカスタム学習させることができます。
Ultralytics YOLO11 を custom-train するには、検出ししたいオブジェクトの画像が含まれるラベル付きデータセットが必要です。たとえば、食料品店でさまざまな種類の果物を識別するモデルを構築する場合、リンゴ、バナナ、オレンジなどのラベル付き画像を含むデータセットを作成します。データセットの準備ができたら、バッチサイズ、学習率、エポックなどのパラメータを調整してパフォーマンスを最適化し、YOLO11 をトレーニングできます。
このアプローチにより、企業は製造業での不良部品から保全プロジェクトでの野生動物まで、あらゆるものを検出できるようにUltralytics YOLO11を学習させ、モデルを正確なニーズに合わせて調整できます。
物体検出のアプリケーション#
次に、物体検出の実世界でのユースケースと、それがどのように様々な業界を変革しているかを見ていきましょう。
自動運転のための危険検知#
Self-driving carsは、オブジェクト検出などのコンピュータービジョンタスクを使用して、安全にナビゲートし、障害物を回避します。この技術は、歩行者、他の車両、ポットホール、道路上の危険を認識するのに役立ち、周囲の状況をよりよく理解することを可能にします。環境を常時分析することで、迅速な決定を下し、交通の中を安全に進むことができます。

Fig 4. Ultralytics YOLO11を使用してポットホールを検出する物体検出の使用例。
ヘルスケアにおける医療画像分析#
X線、MRI、CTスキャン、超音波などのMedical imaging技術は、病気の診断と治療を助けるために人体の詳細な画像を作成します。これらのスキャンは、放射線科医や病理医などの医師が病気を検出するために注意深く分析しなければならない大量のデータを生成します。ただし、すべての画像を詳細に確認するのは時間がかかる場合があり、専門家でも疲労や時間の制約のために詳細を見逃すことがあります。
Ultralytics YOLO11のような物体検出モデルは、臓器、腫瘍、異常などの医療スキャンにおける主要な特徴を高精度で自動的に特定することで支援します。カスタム学習されたモデルは、懸念される領域をBBoxで強調表示し、医師が潜在的な問題に迅速に対処できるよう支援します。これにより、作業負荷が軽減され、効率が向上し、迅速なインサイトが得られます。

Fig 5. Ultralytics YOLO11を使用した医療画像の分析。
人検出と異常検知によるセキュリティの向上#
Object trackingはUltralytics YOLO11がサポートするコンピュータービジョンのタスクであり、リアルタイムのモニタリングとセキュリティの強化を可能にします。これは、オブジェクトを特定し、フレーム間での動きを継続的に追跡することによって物体検出を基盤として構築されています。この技術は、さまざまな環境での安全性を向上させるために監視システムで広く使用されています。
例えば、学校や保育施設では、オブジェクト追跡により子どもたちを見守り、迷子になるのを防ぐことができます。セキュリティアプリケーションにおいては、制限区域への侵入者の検知、混雑や不審な行動の監視、不正行為が検知された際のリアルタイムの警告の送信において重要な役割を果たします。移動するオブジェクトを追跡し続けることにより、Ultralytics YOLO11を活用した追跡システムはセキュリティを強化し、モニタリングを自動化し、潜在的な脅威に対する迅速な対応を可能にします。
物体検出の長所と短所#
物体検出が様々な業界にもたらす重要なメリットをいくつか紹介します。
- 自動化: 物体検出は、CCTV映像の監視といったタスクにおいて、人間の監視の必要性を減らすのに役立ちます。
- 他のAIモデルとの連携: 顔認識、行動認識、追跡システムと統合することで、精度と機能を向上させることができます。
- リアルタイム処理: Ultralytics YOLO11のような多くの物体検出モデルは高速で効率的であり、即座の結果を必要とするリアルタイムアプリケーションに最適です。
これらのメリットは物体検出がどのように異なるユースケースに影響を与えるかを強調していますが、実装に伴う課題を考慮することも重要です。主要な課題をいくつか挙げます。
-
Data privacy: 視覚データ、特に監視やヘルスケアなどの機密性の高い分野での視覚データの使用は、プライバシーの問題やセキュリティの懸念を引き起こす可能性があります。
-
オクルージョン(遮蔽): 物体検出におけるオクルージョンは、物体が部分的に遮られたり隠れたりすることで発生し、モデルが正確に検出して分類することを困難にします。
-
計算コスト: 高性能なモデルは、処理のために強力なGPUが必要になることが多く、リアルタイム導入には費用がかかる場合があります。
重要なポイント#
物体検出は、マシンが画像や動画内のオブジェクトを検出して位置を特定するのに役立つ、コンピュータービジョンにおけるゲームチェンジャーとなるツールです。自動運転車からヘルスケアまで幅広い分野で利用されており、タスクをより簡単、安全、そして効率的にしています。Ultralytics YOLO11のような新しいモデルを使用することで、企業はカスタム物体検出モデルを簡単に作成し、特化したコンピュータービジョンアプリケーションを構築できます。
プライバシーへの懸念や遮蔽といった課題はありますが、物体検出は信頼性の高い技術です。タスクを自動化し、視覚データをリアルタイムで処理し、他の視覚AIツールと統合できるその能力は、最先端のイノベーションにおいて不可欠な要素となっています。
詳細については、GitHub repositoryにアクセスし、our communityにご参加ください。ソリューションページで、AI in self-driving carsやcomputer vision in agricultureなどの分野におけるイノベーションを探索してください。YOLO licensing optionsを確認して、ビジョンAIプロジェクトを実現しましょう。🚀






