コンピュータービジョンの用途の仕組みを探る
コンピュータービジョンの用途を詳しく掘り下げます。物体検出やセグメンテーションなど、さまざまなコンピュータービジョンタスクについても解説します。

コンピュータービジョンモデルの歴史を振り返ると、コンピュータービジョンがどのように進化し、現在の高度なビジョンモデルへと至ったのかが分かります。Ultralytics YOLOv8のような最新のモデルは、複数のコンピュータービジョンタスクをサポートしており、さまざまな興味深いアプリケーションで活用されています。
この記事では、コンピュータービジョンとビジョンモデルの基本を見ていきます。これらの仕組みと、さまざまな業界における多様なアプリケーションについて説明します。コンピュータービジョンのイノベーションは、気付かないうちに私たちの世界を形作りながら、あらゆる場所で活用されています。それらを一つずつ見ていきましょう。
コンピュータービジョンとは?#
人工知能(AI)は、人間の知能の一部を再現することを目指す多くのテクノロジーを包括する総称です。AIのサブフィールドの一つがコンピュータービジョンです。コンピュータービジョンは、機械に周囲を見て、観察し、理解できる目を与えることに焦点を当てています。
人間の視覚と同様に、コンピュータービジョンソリューションは、物体の識別、距離の計算、動きの検出を目指します。しかし、見ることや理解することを助ける生涯にわたる経験を持つ人間とは異なり、コンピューターは膨大な量のデータ、高解像度カメラ、複雑なアルゴリズムに依存します。

図1. 人間の視覚とコンピュータービジョンの比較。
コンピュータービジョンシステムは、画像や動画などの視覚データを驚異的な速度と精度で処理・分析できます。膨大な量の視覚情報を迅速かつ正確に分析できるため、コンピュータービジョンは製造業からヘルスケアまで、さまざまな業界で強力なツールとなっています。
ビジョンモデルはさまざまなコンピュータービジョンタスクをサポートします#
コンピュータービジョンモデルは、あらゆるコンピュータービジョンアプリケーションの中核です。基本的には、機械に視覚情報を解釈して理解する能力を与えるよう設計された、ディープラーニング技術を基盤とする計算アルゴリズムです。ビジョンモデルは、画像分類から物体検出まで、重要なコンピュータービジョンタスクを可能にします。これらのタスクとユースケースについて、さらに詳しく見ていきましょう。
画像分類#
画像分類では、画像をあらかじめ定義されたクラスやカテゴリに分類し、ラベル付けします。YOLOv8のようなビジョンモデルは、ラベル付き画像の大規模なデータセットでトレーニングできます。トレーニング中、モデルは各クラスに関連するパターンや特徴を認識することを学習します。トレーニングが完了すると、学習したパターンと特徴を比較・分析することで、まだ見たことのない新しい画像のカテゴリを予測できます。

図2. 画像分類の例。(出典: towardsdatascience.com)
画像分類にはさまざまな種類があります。たとえば、医療画像を扱う場合、二値分類を使って、画像を健康な状態と病気の状態のような2つのグループに分けることができます。もう一つの種類がマルチクラス分類です。これは、豚、ヤギ、牛などの農場にいるさまざまな動物を分類するように、画像を多数のグループに分類するのに役立ちます。また、動物を哺乳類と鳥類に分類し、さらにライオン、トラ、ワシ、スズメなどの種に分類したい場合は、階層分類が最適です。
物体検出#
物体検出は、コンピュータービジョンを使って画像や動画フレーム内の物体を識別し、その位置を特定するプロセスです。物体の周囲にバウンディングボックスを描画する物体ローカライゼーションと、各物体のカテゴリを識別する物体分類という2つのタスクで構成されます。バウンディングボックスのアノテーションに基づいて、ビジョンモデルは各物体カテゴリに固有のパターンや特徴を認識し、まだ見たことのない新しい画像内の物体の存在と位置を予測できるようになります。
図3. YOLOv8の物体検出を使用してサッカー場の選手を検出。
物体検出には、スポーツから海洋生物学まで、さまざまな業界で多くのユースケースがあります。たとえば小売業では、AmazonのJust Walk Outテクノロジーが物体検出を使用し、顧客が手に取った商品を識別して精算を自動化しています。コンピュータービジョンとセンサーデータを組み合わせることで、顧客は列に並ばずに商品を持って退店できます。
その仕組みを詳しく見てみましょう。
- 天井に設置されたカメラが店内を移動する顧客を撮影し、その映像がビジョンモデルによってリアルタイムで処理されます。
- 物体検出を使用して、顧客が手に取ってバスケットに入れた商品を正確に検出し、それに応じて仮想カートを更新します。
- 棚に設置された重量センサーが、商品の取り出しや戻しを検出して精度を高めます。
- 顧客が店を出る際には、物体検出と顔認識テクノロジーを使用して顧客が退店したことを確認し、クレジットカードなどの決済情報を使って自動的に料金を請求できます。
セマンティックセグメンテーションとインスタンスセグメンテーション#
セマンティックセグメンテーションとインスタンスセグメンテーションは、画像を意味のあるセグメントに分割するコンピュータービジョンタスクです。セマンティックセグメンテーションは、意味に基づいてピクセルを分類し、同じカテゴリに属するすべての物体を同じラベルの一つのエンティティとして扱います。「空」や「海」のように数えられない物体や、「葉」や「草」のような集合のラベル付けに適しています。
一方、インスタンスセグメンテーションは、検出した物体ごとに固有のラベルを割り当てることで、同じクラスに属する異なるインスタンスを区別できます。物体の数や個々の独立性が重要な、数えられる物体のセグメンテーションに使用できます。より正確な識別と区別が可能になります。
図4. セマンティックセグメンテーションとインスタンスセグメンテーションの例。
セマンティックセグメンテーションとインスタンスセグメンテーションの違いは、自動運転車に関連する例でより明確に理解できます。セマンティックセグメンテーションは、シーンの内容を理解する必要があるタスクに適しており、自動運転車で横断歩道や交通標識など、道路上の特徴を分類するために使用できます。一方、インスタンスセグメンテーションは、自動運転車で個々の歩行者、車両、障害物を識別するために使用できます。
姿勢推定#
姿勢推定は、画像や動画内にある物体の姿勢のキーポイントを検出・追跡することに焦点を当てたコンピュータービジョンタスクです。最も一般的には人体姿勢推定に使用され、肩や膝などがキーポイントになります。人間の姿勢を推定することで、さまざまなアプリケーションにとって重要な動作や動きを理解し、認識できます。

図5. YOLOv8を使用した姿勢推定の例。
姿勢推定は、スポーツにおけるアスリートの動きの分析に使用できます。NBAでは、試合中の選手の動きや位置を調査するために姿勢推定を使用しています。肩、肘、膝、足首などのキーポイントを追跡することで、姿勢推定は選手の動きに関する詳細なインサイトを提供します。こうしたインサイトは、コーチによる戦略の改善、トレーニングプログラムの最適化、試合中のリアルタイム調整に役立ちます。また、選手の疲労や負傷リスクのモニタリングにもデータを活用でき、選手全体の健康状態とパフォーマンスの向上につながります。
指向性バウンディングボックス物体検出#
指向性バウンディングボックス物体検出(OBB)は、回転した長方形を使用して画像内の物体を正確に識別し、その位置を特定します。画像の軸に沿って配置される標準的なバウンディングボックスとは異なり、OBBは物体の向きに合わせて回転します。そのため、完全に水平または垂直ではない物体に特に有用です。回転した物体を正確に特定して分離できるため、混雑した環境での重なりを防ぐのに適しています。
図6. YOLOv8を使用した船舶の航空画像における指向性バウンディングボックス検出の例。
海事監視では、船舶の識別と追跡がセキュリティとリソース管理の鍵となります。OBB検出は、船舶が密集している場合やさまざまな角度を向いている場合でも、船舶の正確な位置特定に使用できます。航路の監視、海上交通の管理、港湾運用の最適化に役立ちます。また、ハリケーンや油流出などの災害後に船舶やインフラへの損害を迅速に特定・評価することで、災害対応にも貢献できます。
物体追跡#
ここまで、画像を扱うコンピュータービジョンタスクについて説明してきました。物体追跡は、動画のフレーム全体にわたって物体を追跡できるコンピュータービジョンタスクです。まず検出アルゴリズムを使って最初のフレームで物体を識別し、その後、動画内を移動する物体の位置を継続的に追跡します。物体追跡には、追跡精度を維持するための物体検出、特徴抽出、動きの予測などの技術が含まれます。

図7. YOLOv8を使用した魚の追跡。
YOLOv8のようなビジョンモデルは、海洋生物学における魚の追跡に使用できます。水中カメラを使用して、研究者は自然な生息環境にいる魚の動きや行動をモニタリングできます。まず最初のフレームで個々の魚を検出し、その後、動画全体を通じて魚の位置を追跡します。魚を追跡することで、科学者は回遊パターン、社会行動、環境との相互作用を理解できます。また、魚の分布や生息数に関するインサイトを提供し、持続可能な漁業にも貢献します。
コンピュータービジョンのまとめ#
コンピュータービジョンは、テクノロジーの利用方法や世界との関わり方を積極的に変えています。ディープラーニングモデルと複雑なアルゴリズムを使って画像や動画を理解することで、コンピュータービジョンはさまざまな業界の多くのプロセスを効率化します。物体検出や物体追跡などのコンピュータービジョンタスクによって、これまで想像もされなかったソリューションの創出が可能になっています。コンピュータービジョンテクノロジーが進歩し続けるなか、未来にはさらに多くの革新的なアプリケーションが期待されます。
一緒に学び、成長していきましょう。GitHubリポジトリで、AIに対する私たちの貢献をご覧ください。AIによって自動運転車や農業などの業界をどのように再定義しているかもご確認ください。🚀






