物体検出とUltralyticsのYOLOモデルの進化
物体検出の進化を振り返ります。ここ数年でYOLO(1回見るだけ)のモデルがどのように進化してきたかに焦点を当てます。

コンピュータービジョンは、人工知能(AI)の一分野であり、人間が現実世界を認識する方法と同様に、機械に画像や動画を見て理解する方法を教えることに焦点を当てています。物体の認識や行動の識別は人間にとって自然なことですが、機械でこれらのタスクを実行するには、専門的なコンピュータービジョン技術が必要です。例えば、コンピュータービジョンにおける重要なタスクの1つに物体検出があります。これは、画像や動画内の物体を識別し、その位置を特定する処理です。
1960年代以降、研究者たちはコンピューターによる物体検出の改善に取り組んできました。初期の手法であるテンプレートマッチングでは、あらかじめ定義したテンプレートを画像上でスライドさせ、一致する箇所を探していました。革新的ではありましたが、これらの手法は物体のサイズや向き、照明の変化への対応に苦労しました。現在では、Ultralytics YOLO11のような高度なモデルにより、遮蔽物によって一部が隠れた物体(オクルージョン物体)を含む、小さな物体や部分的に隠れた物体も高い精度で検出できます。
コンピュータービジョンが進化し続ける中で、これらの技術がどのように発展してきたのかを振り返ることは重要です。この記事では、物体検出の進化をたどり、YOLO(You Only Look Once)モデルの変遷に注目します。それでは始めましょう。
コンピュータービジョンの起源#
物体検出について詳しく見ていく前に、コンピュータービジョンがどのように始まったのかを確認しましょう。コンピュータービジョンの起源は、科学者たちが脳による視覚情報の処理方法を研究し始めた1950年代後半から1960年代初頭にさかのぼります。猫を使った実験で、研究者のDavid HubelとTorsten Wieselは、脳がエッジや線などの単純なパターンに反応することを発見しました。これは特徴抽出の考え方の基礎となりました。つまり、視覚システムは、より複雑なパターンに進む前に、画像内のエッジなどの基本的な特徴を検出して認識するという概念です。

図1.猫の脳が光の棒に反応する仕組みの研究は、コンピュータービジョンにおける特徴抽出の発展に役立ちました。
同じ頃、物理的な画像をデジタル形式に変換できる新しい技術が登場し、機械が視覚情報を処理する方法への関心が高まりました。1966年、マサチューセッツ工科大学(MIT)のSummer Vision Projectは、この研究をさらに前進させました。このプロジェクトは完全な成功には至りませんでしたが、画像内の前景と背景を分離できるシステムの構築を目指しました。ビジョンAIコミュニティの多くの人々にとって、このプロジェクトは科学分野としてのコンピュータービジョンの公式な始まりを示すものです。
物体検出の歴史を理解する#
1990年代後半から2000年代初頭にかけてコンピュータービジョンが進歩すると、物体検出の手法はテンプレートマッチングのような基本的な技術から、より高度なアプローチへと移行しました。広く利用された手法の1つがHaar Cascadeで、顔検出などのタスクに用いられました。これはスライディングウィンドウで画像を走査し、画像の各領域でエッジやテクスチャなどの特定の特徴を確認した後、それらの特徴を組み合わせて顔などの物体を検出します。Haar Cascadeは従来の手法よりもはるかに高速でした。

図2.顔検出にHaar Cascadeを使用。
これらと並行して、勾配方向ヒストグラム(HOG)やサポートベクターマシン(SVMs)などの手法も登場しました。HOGはスライディングウィンドウ技術を使用して、画像の小さな領域における光と影の変化を分析し、形状に基づく物体の識別を支援しました。次にSVMsがこれらの特徴を分類し、物体の正体を判定しました。これらの手法は精度を向上させましたが、実環境では依然として課題があり、現在の技術と比べて処理速度も低速でした。
リアルタイム物体検出の必要性#
2010年代には、ディープラーニングと畳み込みニューラルネットワーク(CNNs)の台頭により、物体検出に大きな変化がもたらされました。CNNsによって、コンピューターは大量のデータから重要な特徴を自動的に学習できるようになり、検出精度が大幅に向上しました。
R-CNN(領域ベースの畳み込みニューラルネットワーク)のような初期のモデルは、精密度を大きく改善し、従来の手法よりも正確に物体を識別できるようになりました。
しかし、これらのモデルは画像を複数の段階に分けて処理するため低速であり、自動運転車やビデオ監視などのリアルタイムアプリケーションでの利用には適していませんでした。
処理速度の向上を目指して、より効率的なモデルが開発されました。Fast R-CNNやFaster R-CNNなどのモデルは、関心領域の選択方法を改良し、検出に必要なステップ数を削減することで貢献しました。これにより物体検出は高速化しましたが、即時の結果を必要とする多くの実世界のアプリケーションにとっては、依然として十分な速度ではありませんでした。リアルタイム検出への需要の高まりにより、速度と精度の両方を両立できる、さらに高速で効率的なソリューションの開発が進みました。

図3. R-CNN、Fast R-CNN、Faster R-CNNの速度比較。
YOLO(You Only Look Once)モデル:大きなマイルストーン#
YOLOは、画像や動画内の複数の物体をリアルタイムで検出できるようにすることでコンピュータービジョンを一新した物体検出モデルであり、従来の検出手法とは大きく異なります。検出した物体を1つずつ分析するのではなく、YOLOのアーキテクチャは物体検出を単一のタスクとして扱い、CNNsを使用して物体の位置とクラスを一度に予測します。
このモデルは画像をグリッドに分割し、各部分が担当する領域内の物体を検出します。各セクションについて複数の予測を行い、信頼度の低い結果を除外して、精度の高い結果だけを残します。

図4. YOLOの仕組みの概要。
YOLOがコンピュータービジョンアプリケーションに導入されたことで、物体検出は従来のモデルよりもはるかに高速かつ効率的になりました。速度と精度を兼ね備えていたため、YOLOは製造、医療、ロボティクスなどの業界におけるリアルタイムソリューションで、すぐに人気の選択肢となりました。
もう1つ重要な点は、YOLOがオープンソースだったため、開発者や研究者が継続的に改善でき、さらに高度なバージョンへと発展したことです。
YOLOからUltralytics YOLO11までの歩み#
YOLOモデルは、それぞれのバージョンの進歩を基盤として、時間とともに着実に改善されてきました。性能が向上しただけでなく、これらの改良によって、さまざまな技術レベルのユーザーがモデルを使いやすくなりました。
例えば、Ultralytics YOLOv5の導入により、モデルのデプロイがPyTorchで簡単に行えるようになり、より幅広いユーザーが高度なAIを扱えるようになりました。精度と使いやすさを両立し、コーディングの専門家でなくても物体検出を実装できるようにしました。

図5. YOLOモデルの進化。
Ultralytics YOLOv8は、インスタンスセグメンテーションなどのタスクへの対応を追加し、モデルの柔軟性を高めることで、この進歩をさらに推し進めました。基本的なアプリケーションからより複雑なアプリケーションまで、YOLOを簡単に利用できるようになり、幅広いシナリオで役立つモデルとなりました。
最新モデルのUltralytics YOLO11では、さらなる最適化が施されています。パラメーター数を削減しながら精度を向上させたことで、リアルタイムタスクにおける効率がさらに高まりました。経験豊富な開発者でもAIを初めて扱う方でも、YOLO11なら物体検出への高度なアプローチを簡単に利用できます。
Ultralytics YOLO11を知る:新機能と改善点#
Ultralyticsの年次ハイブリッドイベントであるYOLO Vision 2024(YV24)で発表されたYOLO11は、YOLOv8と同じコンピュータービジョンタスクである物体検出、インスタンスセグメンテーション、画像分類、姿勢推定に対応しています。そのため、ユーザーはワークフローを調整することなく、この新しいモデルへ簡単に切り替えられます。さらに、YOLO11の改良されたアーキテクチャにより、予測精度が一段と向上しています。実際、YOLO11mはYOLOv8mよりパラメーター数が22%少ないにもかかわらず、COCOデータセットでより高い平均適合率(mAP)を達成します。
YOLO11は、スマートフォンやその他のエッジデバイスから、より高性能なクラウドシステムまで、さまざまなプラットフォームで効率的に動作するよう設計されています。この柔軟性により、リアルタイムアプリケーション向けに、さまざまなハードウェア構成で安定した性能を実現できます。さらに、YOLO11はより高速かつ効率的で、計算コストを削減し、推論時間を短縮します。Ultralytics Pythonパッケージを使用する場合でも、ノーコードのUltralytics HUBを使用する場合でも、既存のワークフローにYOLO11を簡単に統合できます。
YOLOモデルと物体検出の未来#
高度な物体検出がリアルタイムアプリケーションやエッジAIに与える影響は、すでにさまざまな業界で現れています。石油・ガス、医療、小売などの分野でAIへの依存が高まるにつれ、高速で正確な物体検出への需要は増え続けています。Ultralytics YOLO11は、計算能力に制約のあるデバイスでも高性能な検出を可能にすることで、この需要に応えようとしています。
エッジAIが発展するにつれて、速度と精度が重要となる環境でのリアルタイム意思決定において、Ultralytics YOLO11のような物体検出モデルはさらに不可欠になる可能性があります。設計と適応性の継続的な改善により、物体検出の未来には、さまざまなアプリケーションでさらなるイノベーションがもたらされると考えられます。
主なポイント#
物体検出は、単純な手法から現在の高度なディープラーニング技術へと進化し、長い道のりを歩んできました。YOLOモデルはこの進歩の中心的な役割を果たし、さまざまな業界で、より高速で正確なリアルタイム検出を実現してきました。Ultralytics YOLO11はこのレガシーを受け継ぎ、効率を高め、計算コストを削減し、精度を向上させることで、さまざまなリアルタイムアプリケーションに適した信頼性の高い選択肢となっています。AIとコンピュータービジョンが進歩し続ける中、物体検出の未来は明るく、速度、精度、適応性のさらなる向上が期待されます。
AIに興味がありますか?コミュニティに参加して、学びを続けましょう。GitHubリポジトリをチェックして、製造や医療などの業界でAIを活用して革新的なソリューションを生み出す方法をご覧ください。🚀









