コンピュータビジョンの応用がどのように機能するかを探る
コンピュータビジョンの応用について深く掘り下げます。また、物体検知やセグメンテーションといった様々なコンピュータビジョンのタスクについても解説します。

コンピュータビジョンモデルの歴史について探求した際に、コンピュータビジョンがどのように進化し、現在私たちが利用している高度なビジョンモデルに至るまでの道のりを確認しました。Ultralytics YOLOv8のような現代のモデルは、複数のコンピュータビジョンのタスクをサポートしており、さまざまなエキサイティングなアプリケーションで活用されています。
本記事では、コンピュータビジョンとビジョンモデルの基礎について解説します。それらがどのように機能し、さまざまな業界でどのように応用されているのかを見ていきましょう。コンピュータビジョンのイノベーションは至る所に存在し、静かに世界を形作っています。一つずつ解き明かしていきましょう。
コンピュータビジョンとは何か?#
人工知能(AI)は、人間の知能の一部を再現することを目指す多くの技術を包含する包括的な用語です。AIのサブフィールドの一つがコンピュータビジョンです。コンピュータビジョンは、機械に周囲を見、観察し、理解できる「目」を与えることに焦点を当てています。
人間の視覚と同様に、コンピュータビジョンソリューションは、物体を識別し、距離を計算し、動きを検出することを目指します。しかし、見る・理解するための生涯にわたる経験を持つ人間とは異なり、コンピュータは膨大な量のデータ、高解像度カメラ、そして複雑なアルゴリズムに依存しています。

図 1 人間の視覚とコンピュータビジョンの比較。
コンピュータビジョンシステムは、画像や動画などの視覚データを驚異的な速度と精度で処理および解析できます。膨大な量の視覚情報を素早く正確に解析できる能力により、コンピュータビジョンは製造業からヘルスケアまで、さまざまな業界において強力なツールとなっています。
ビジョンモデルはさまざまなコンピュータビジョンタスクをサポートします#
コンピュータビジョンモデルは、あらゆるコンピュータビジョンアプリケーションの核心です。これらは基本的に、ディープラーニング技術を活用した計算アルゴリズムであり、機械に視覚情報を解釈および理解する能力を与えるために設計されています。ビジョンモデルにより、画像分類からオブジェクト検出に至るまで、重要なコンピュータビジョンのタスクが可能になります。これらのタスクの一部と、そのユースケースについてさらに詳しく見ていきましょう。
画像分類#
画像分類には、画像を事前に定義されたクラスやカテゴリに分類およびラベリングすることが含まれます。YOLOv8のようなビジョンモデルは、ラベリングされた画像の大量のデータセットでトレーニングできます。トレーニング中、モデルは各カテゴリに関連するパターンや特徴を認識することを学習します。トレーニングが完了すると、学習したパターンと特徴を比較・分析することで、新しい未見の画像のカテゴリを予測できるようになります。

図2. 画像分類の例。(出典: towardsdatascience.com)
画像分類にはいくつかの種類があります。例えば、医療画像を扱う場合、二値分類を使用して画像を健康な状態や病気の状態などの2つのグループに分けることができます。もう1つの種類はマルチクラス分類です。これは、豚、ヤギ、牛などの農場のさまざまな動物の分類のように、画像を多くのグループに分類するのに役立ちます。あるいは、動物を哺乳類や鳥類などのグループやサブグループに分類し、さらにライオン、トラ、ワシ、スズメなどの種に細分化したい場合は、階層分類が最適なオプションとなります。
オブジェクト検出#
物体検出は、コンピュータビジョンを使用して画像やビデオフレーム内の物体を特定し、配置を特定するプロセスです。これには、物体の周囲にバウンディングボックスを描画する「物体ローカライゼーション」と、各物体のカテゴリを特定する「物体分類」という2つのタスクが含まれます。バウンディングボックスのアノテーションに基づき、ビジョンモデルは各物体カテゴリに固有のパターンや特徴を認識し、新しい未知の画像内でのこれらの物体の存在と位置を予測することを学習します。
図3. サッカー場で選手を検出するために使用されているYOLOv8の物体検出。
オブジェクト検出には、スポーツから海洋生物学まで、さまざまな業界で多くのユースケースがあります。例えば、リテール業界では、Amazon の Just Walk Outテクノロジーがオブジェクト検出を使用して、顧客が手に取ったアイテムを識別し、チェックアウトを自動化しています。コンピュータビジョンとセンサーデータの組み合わせにより、顧客は列に並ぶことなく、商品を持って退店することができます。
その仕組みを詳しく見てみましょう:
- 天井に取り付けられたカメラが店内を移動する顧客を捉え、この映像はビジョンモデルによってリアルタイムで処理されます。
- 物体検出を使用して、顧客が手に取りバスケットに入れた正確な商品を検出し、それに応じて仮想カートを更新します。
- 棚にある重量センサーは、商品の取り出しや補充を検出することで精度を向上させます。
- 顧客が店舗から退出する際、オブジェクト検出と顔認識テクノロジーを使用して顧客が退店したことを確認でき、クレジットカードなどの支払い情報を使用して自動的に請求を行うことができます。
セマンティックセグメンテーションとインスタンスセグメンテーション#
セマンティックセグメンテーションとインスタンスセグメンテーションは、画像を意味のあるセグメントに分割するのに役立つコンピュータビジョンのタスクです。セマンティックセグメンテーションは、ピクセルをその意味に基づいて分類し、カテゴリ内のすべてのオブジェクトを同じラベルを持つ単一のエンティティとして扱います。「空」や「海」のような数えられないオブジェクトや、「葉」や「草」のようなクラスターにラベルを付けるのに適しています。
一方、インスタンスセグメンテーションは、検出された各物体に固有のラベルを割り当てることで、同じクラスの異なるインスタンスを識別できます。インスタンスセグメンテーションを使用すると、物体の数や独立性が重要な、数えられる物体をセグメント化できます。これにより、より正確な識別と差別化が可能になります。
図4. セマンティックセグメンテーションとインスタンスセグメンテーションの例。
自動運転車に関連する例を通じて、セマンティックセグメンテーションとインスタンスセグメンテーションのコントラストをより明確に理解できます。セマンティックセグメンテーションは、シーンの内容を理解する必要があるタスクに最適であり、自動運転車で横断歩道や道路標識などの道路上の特徴を分類するために使用できます。一方、インスタンスセグメンテーションは、自動運転車で個々の歩行者、車両、障害物を識別するために使用できます。
姿勢推定#
姿勢推定は、画像または動画内のオブジェクトのポーズのキーポイントを検出して追跡することに特化したコンピュータビジョンのタスクです。これは主に人間の姿勢推定に使用され、肩や膝などの領域がキーポイントに含まれます。人間の姿勢を推定することは、さまざまなアプリケーションで不可欠なアクションや動きを理解および認識するのに役立ちます。

図 5 YOLOv8 を使用した姿勢推定の例。
姿勢推定はスポーツにおいて、アスリートの動きを分析するために使用できます。NBAでは、試合中の選手の動きや位置を研究するために姿勢推定を使用しています。肩、肘、膝、足首などのキーポイントを追跡することで、姿勢推定は選手の動きに関する詳細なインサイトを提供します。これらのインサイトは、コーチがより良い戦略を立て、トレーニングプログラムを最適化し、試合中にリアルタイムの調整を行うのに役立ちます。また、このデータは選手が疲労や怪我のリスクを監視し、全体的な選手の健康とパフォーマンスを向上させるのにも役立ちます。
回転バウンディングボックスによる物体検出#
方向付きバウンディングボックスオブジェクト検出(OBB)は、回転した長方形を使用して画像内のオブジェクトを正確に特定し位置を特定します。画像軸に合わせる標準的なバウンディングボックスとは異なり、OBB はオブジェクトの向きに合わせて回転します。これにより、完全に水平でも垂直でもないオブジェクトに特に役立ちます。混雑した環境で回転したオブジェクトを正確に特定して分離し、重なりを防ぐのに優れています。
図6. YOLOv8を使用したボートの航空画像における回転バウンディングボックス検出の例。
海洋監視において、船舶の識別と追跡はセキュリティとリソース管理の鍵となります。OBB 検出は、密集している場合やさまざまな角度を向いている場合でも、船舶の正確な位置特定に使用できます。これにより、航路の監視、海上交通の管理、港湾運営の最適化を支援します。また、ハリケーンや原油流出などのイベントの後に船舶やインフラストラクチャへの損害を迅速に特定して評価することで、災害対応を支援することもできます。
物体追跡#
ここまでは、画像を扱うコンピュータビジョンのタスクについて説明してきました。オブジェクトトラッキングは、動画のフレーム全体にわたってオブジェクトを追跡できるコンピュータビジョンのタスクです。まず検出アルゴリズムを使用して最初のフレームでオブジェクトを識別し、その後、動画内を移動するにつれてその位置を継続的に追跡します。オブジェクトトラッキングには、追跡の精度を維持するためのオブジェクト検出、特徴抽出、および動き予測などの技術が含まれます。

図7. YOLOv8を使用した魚の追跡。
YOLOv8 などのビジョンモデルは、海洋生物学での魚の追跡に使用できます。水中カメラを使用して、研究者は自然の生息地における魚の動きや行動を監視できます。プロセスは、最初のフレームで個々の魚を検出し、動画全体を通じてその位置を追跡することから始まります。魚を追跡することで、科学者は移動パターン、社会行動、環境との相互作用を理解できるようになります。また、魚の分布や個体数に関する洞察を提供することで、持続可能な漁業慣行もサポートします。
コンピュータビジョンの最終展望#
コンピュータビジョンは、私たちが技術を使用し、世界と関わる方法を積極的に変えています。ディープラーニングモデルと複雑なアルゴリズムを使用して画像や動画を理解することで、コンピュータビジョンは業界が多くのプロセスを効率化するのを支援しています。物体検出や物体追跡のようなコンピュータビジョンタスクは、これまで想像もしなかったソリューションを作り出すことを可能にしています。コンピュータビジョン技術が進化し続けるにつれ、未来にはさらに多くの革新的なアプリケーションが待っています!
一緒に学び、成長していきましょう!GitHub repositoryを探索して、AIへの私たちの貢献をご覧ください。私たちがAIでself-driving carsやagricultureなどの業界をどのように再定義しているかをご確認ください。🚀






