物体検知とUltralyticsのYOLOモデルの進化
物体検知の進化を振り返ります。近年のYOLO (You Only Look Once) モデルがどのように進歩してきたかに焦点を当てます。

Computer visionは、人間が現実世界を知覚する方法と同様に、機械に画像や動画を見て理解させることを目的とする人工知能(AI)のサブフィールドです。物体を認識することやアクションを特定することは人間にとって当たり前のことですが、機械の場合、これらのタスクには具体的で専門的なコンピュータビジョン技術が必要です。例えば、コンピュータビジョンにおける重要なタスクの1つに物体検出があります。これは、画像や動画内の物体を特定し、その位置を特定するものです。
1960年代以降、研究者たちはコンピュータによる物体検出の精度向上に取り組んできました。テンプレートマッチングのような初期の手法は、事前に定義されたテンプレートを画像上でスライドさせて一致する部分を探すというものでした。これらのアプローチは革新的であったものの、物体のサイズ、向き、照明の変化への対応に苦労しました。現在では、Ultralytics YOLO11のような高度なモデルがあり、オクルージョン(一部が隠れている状態)のある小さな物体や部分的に隠れた物体であっても、驚異的な精度で検出できます。
Computer visionが進化し続けるにつれて、これらの技術がどのように発展してきたかを振り返ることは重要です。この記事では、物体検出の進化を探求し、YOLO (You Only Look Once) modelsの変遷にスポットライトを当てます。それでは始めましょう!
コンピュータビジョンの起源#
物体検出に飛び込む前に、computer visionがどのように始まったのかを見てみましょう。コンピュータビジョンの起源は1950年代後半から1960年代初頭に遡り、科学者たちが脳が視覚情報をどのように処理するかについての探求を始めた時期です。ネコを用いた実験において、研究者であるデヴィッド・ヒューベルとトルステン・ウーセルは、脳がエッジや線のような単純なパターンに反応することを発見しました。これが特徴抽出のアイデアの基礎となりました。つまり、視覚システムが、より複雑なパターンに進む前に、画像内のエッジなどの基本的な特徴を検出して認識するというコンセプトです。

Fig 1. ネコの脳が光のバーにどのように反応するかを学ぶことは、コンピュータビジョンにおける特徴抽出の発展に役立ちました。
ほぼ同時期に、物理的な画像をデジタル形式に変換できる新しいテクノロジーが登場し、機械が視覚情報をどのように処理できるかについての関心が高まりました。1966年、マサチューセッツ工科大学(MIT)のサマービジョンプロジェクトがさらに状況を前進させました。このプロジェクトは完全には成功しなかったものの、画像内の前景と背景を分離できるシステムを作成することを目指していました。ビジョンAIコミュニティの多くの人にとって、このプロジェクトは科学分野としてのcomputer visionの正式な始まりを示しています。
オブジェクト検出の歴史を理解する#
1990年代後半から2000年代初頭にかけてcomputer visionが進歩するにつれて、物体検出の手法は、テンプレートマッチングなどの基本技術から、より高度なアプローチへと移行しました。一般的な手法の1つにHaar Cascadeがあり、顔検出などのタスクで広く使われるようになりました。これは、スライディングウィンドウで画像をスキャンし、画像の各セクションのエッジやテクスチャなどの特定の特徴をチェックし、これらの特徴を組み合わせて顔などの物体を検出するという仕組みでした。Haar Cascadeは従来の方法よりもはるかに高速でした。

Fig 2. 顔検出へのHaar Cascadeの使用。
これらと並行して、HOG(Histogram of Oriented Gradients)やSVM(Support Vector Machines)などの手法も導入されました。HOGはスライディングウィンドウ技術を使用して画像的小領域における光と影の変化を分析し、形状に基づいた物体の特定を支援しました。その後、SVMがこれらの特徴を分類して、物体の正体を決定しました。これらの手法により精度は向上したものの、現実環境での処理には依然として苦労し、今日の技術と比較して低速でした。
リアルタイムオブジェクト検出の必要性#
2010年代には、deep learningとConvolutional Neural Networks (CNNs)の台頭により、物体検出に大きな転換がもたらされました。CNNにより、コンピュータは大量のデータから重要な特徴を自動的に学習できるようになり、検出精度が飛躍的に向上しました。
R-CNN (Region-based Convolutional Neural Networks)のような初期モデルは精度において大幅な改善となり、従来の方法よりもより正確に物体を識別するのに役立ちました。
しかし、これらのモデルは画像を複数段階で処理するため低速であり、自動運転車やビデオ監視などの分野におけるリアルタイムアプリケーションには実用的ではありませんでした。
高速化に焦点を当て、より効率的なモデルが開発されました。Fast R-CNNやFaster R-CNNなどのモデルは、関心領域の選定方法を洗練させ、検出に必要なステップ数を削減することで貢献しました。これにより物体検出は高速化されたものの、インスタントな結果を必要とする多くの現実世界のアプリケーションにとって、依然として十分な速さではありませんでした。リアルタイム検出に対する需要の高まりが、速度と精度の両方をバランスさせることができる、さらに高速で効率的なソリューションの開発を推進しました。

図3. R-CNN、Fast R-CNN、Faster R-CNNの速度比較。
YOLO (You Only Look Once) モデル:大きなマイルストーン#
YOLOは、画像や動画内の複数の物体のリアルタイム検出を可能にすることでコンピュータビジョンを再定義した物体検出モデルであり、以前の検出方法とは非常にユニークな存在となっています。検出された各物体を個別に分析する代わりに、YOLOのアーキテクチャは物体検出を単一のタスクとして扱い、CNNを使用して一度に物体の位置とクラスの両方を予測します。
このモデルは画像をグリッドに分割し、各部分がそれぞれの領域内の物体検出を担当する仕組みで動作します。各セクションに対して複数の予測を行い、確信度の低い結果をフィルタリングして除外することで、正確な結果のみを保持します。

Fig 4. YOLOの動作の概要。
YOLOがコンピュータビジョンアプリケーションに導入されたことで、物体検出は以前のモデルよりもはるかに高速かつ効率的になりました。その速度と精度の高さから、YOLOは製造業、ヘルスケア、ロボット工学などの業界におけるリアルタイムソリューションの人気の選択肢として急速に定着しました。
もう一つ重要な点は、YOLOはオープンソースであるため、開発者や研究者が継続的に改良を重ね、さらに高度なバージョンが開発されてきたことです。
YOLOからUltralytics YOLO11への歩み#
YOLOモデルは、各バージョンの進歩の上に成り立ち、時とともに着実に改善されてきました。パフォーマンスの向上に加え、これらの改良により、技術的な経験レベルを問わず多くの人が使いやすいモデルになっています。
例えば、Ultralytics YOLOv5が導入された際、PyTorchによりモデルのデプロイがシンプルになり、より幅広いユーザーが高度なAIを扱えるようになりました。精度と使いやすさが融合し、コーディングのエキスパートでなくても、より多くの人々が物体検出を実装する能力を得られるようになりました。

図5. YOLOモデルの進化。
Ultralytics YOLOv8は、インスタンスセグメンテーションなどのタスクのサポートを追加し、モデルの柔軟性を高めることで、この進歩を継続させました。基礎的なアプリケーションからより複雑なアプリケーションまでYOLOを使用することが容易になり、さまざまなシナリオで有用なものとなりました。
最新モデルのUltralytics YOLO11では、さらなる最適化が行われています。パラメータ数を削減しつつ精度を向上させることで、リアルタイムタスクにおいてより効率的になりました。経験豊富な開発者であってもAI初心者であっても、YOLO11は簡単にアクセスできる高度な物体検出アプローチを提供します。
Ultralytics YOLO11を知る:新機能と改善点#
Ultralyticsの年次ハイブリッドイベントであるYOLO Vision 2024 (YV24)で発表されたYOLO11は、物体検出、インスタンスセグメンテーション、画像分類、姿勢推定など、YOLOv8と同じコンピュータビジョンタスクをサポートしています。そのため、ユーザーはワークフローを調整することなく、この新しいモデルに簡単に移行できます。さらに、YOLO11のアップグレードされたアーキテクチャにより、予測精度がさらに向上しています。実際、YOLO11mは、YOLOv8mよりも22%少ないパラメータ数で、COCOデータセット上でより高い平均精度(mAP)を達成しています。
YOLO11はまた、スマートフォンやその他のエッジデバイスからより強力なクラウドシステムまで、さまざまなプラットフォーム上で効率的に実行できるように構築されています。この柔軟性により、リアルタイムアプリケーション向けに異なるハードウェア構成間でもスムーズなパフォーマンスが保証されます。その上、YOLO11はより高速かつ効率的であり、計算コストを削減し、推論時間を短縮します。Ultralytics Python packageを使用する場合でも、ノーコードのUltralytics HUBを使用する場合でも、既存のワークフローにYOLO11を簡単に統合できます。
YOLOモデルとオブジェクト検出の未来#
高度な物体検出がリアルタイムアプリケーションやエッジAIに与える影響は、すでにさまざまな業界で実感されています。石油・ガス、ヘルスケア、retailなどの分野でAIへの依存度が高まるにつれて、高速で高精度な物体検出への需要は高まり続けています。Ultralytics YOLO11は、計算能力が制限されたデバイス上でも高性能な検出を可能にすることで、この需要に応えることを目指しています。
edge AIの成長に伴い、Ultralytics YOLO11のような物体検出モデルは、速度と精度が不可欠な環境でのリアルタイムの意思決定において、さらに不可欠なものになると予想されます。設計と適応性の継続的な改善により、物体検出の未来はさまざまなアプリケーションでさらなるイノベーションをもたらすことが期待されます。
重要なポイント#
物体検出は長い道のりを経て、単純な手法から、私たちが今日目にする高度なディープラーニング技術へと進化してきました。YOLOモデルはこの進歩の中心にあり、さまざまな業界でより高速で精度の高いリアルタイム検出を実現してきました。Ultralytics YOLO11はこの遺産を受け継ぎ、効率性の向上、計算コストの削減、精度の向上を実現しており、さまざまなリアルタイムアプリケーションにとって信頼できる選択肢となっています。AIとコンピュータビジョンの継続的な進歩により、物体検出の未来は明るく、速度、精度、適応性の面でさらなる改善の余地が残されています。
AIについてもっと知りたいですか?コミュニティにつながって学習を続けましょう!GitHubリポジトリをチェックして、製造業やヘルスケアなどの業界でAIを活用して革新的なソリューションをどのように生み出しているかを発見してください。🚀






