Ultralytics YOLO27:
ビジョンAI

Mask R-CNNとは何か、その仕組みとは?

Mask R-CNNを使用して画像や動画内のオブジェクトを高精度にセグメンテーションし、さまざまな業界の多様な用途に活用する方法を解説します。

ABAbirami Vina9 min read
Mask R-CNNによるインスタンスセグメンテーション

AIの導入が進むにつれて、倉庫内のロボット、混雑した道路を安全に走行する自動運転車、作物を確認するドローン、工場で製品を検査するAIシステムなどのイノベーションが、ますます一般的になっています。こうしたイノベーションを支える重要なテクノロジーがコンピュータービジョンです。これは、機械が視覚データを理解して解釈できるようにするAIの一分野です。

例えば、物体検出は、バウンディングボックスを使用して画像内の物体を識別し、その位置を特定するコンピュータービジョンのタスクです。バウンディングボックスは有用な情報を提供しますが、物体の位置を大まかに推定するだけで、正確な形状や境界を捉えることはできません。そのため、正確な識別が必要なアプリケーションでは効果が低くなります。

この問題を解決するため、研究者は物体の正確な輪郭を捉え、より精度の高い検出と分析を可能にするピクセルレベルの詳細情報を提供するセグメンテーションモデルを開発しました。

Mask R-CNNは、こうしたモデルの1つです。2017年にFacebook AI Research(FAIR)によって発表され、R-CNN、Fast R-CNN、Faster R-CNNなどの従来のモデルを基盤としています。コンピュータービジョンの歴史における重要なマイルストーンとして、Mask R-CNNはUltralytics YOLO11など、より高度なモデルへの道を切り開きました。

この記事では、Mask R-CNNとは何か、その仕組みや用途、そしてUltralytics YOLO11へとつながる、その後の改良について説明します。

Mask R-CNNの概要#

Mask R-CNNはMask Region-based Convolutional Neural Networkの略で、物体検出やインスタンスセグメンテーションなどのコンピュータービジョンタスク向けに設計された深層学習モデルです。

インスタンスセグメンテーションは、画像内の物体を識別するだけでなく、それぞれの輪郭を正確に描画することで、従来の物体検出を上回ります。検出したすべての物体に固有のラベルを付与し、ピクセルレベルで正確な形状を捉えます。この詳細なアプローチにより、重なり合う物体を明確に区別し、複雑な形状にも正確に対応できます。

Mask R-CNNは、物体を検出してラベル付けする一方で、正確な形状までは定義しないFaster R-CNNを基盤としています。Mask R-CNNは、各物体を構成する正確なピクセルを特定することでこれを改良し、より詳細で精度の高い画像分析を可能にします。

物体検出とインスタンスセグメンテーションの比較

図1. 物体検出とインスタンスセグメンテーションの比較。

Mask R-CNNのアーキテクチャと仕組み#

Mask R-CNNは、物体を正確に検出してセグメンテーションするため、段階的なアプローチを取ります。まず、ディープニューラルネットワーク(データから学習する多層モデル)を使用して主要な特徴を抽出し、次にリージョンプロポーザルネットワーク(物体が存在する可能性の高い領域を提案するコンポーネント)で物体候補の領域を特定し、最後に詳細なセグメンテーションマスク(物体の正確な輪郭)を作成して、これらの領域を改良します。

次に、Mask R-CNNの仕組みをより深く理解するため、各ステップを順に見ていきます。

Mask R-CNNのアーキテクチャの概要

図2. Mask R-CNNのアーキテクチャの概要(出典:researchgate.net)。

特徴抽出から始める#

Mask R-CNNのアーキテクチャにおける最初のステップは、モデルが画像の内容を理解できるよう、画像を主要な部分に分解することです。写真を見るときに、形状や色、エッジなどの細部に自然と気づくのと同じようなものです。モデルは「バックボーン」と呼ばれるディープニューラルネットワーク(多くの場合、ResNet-50またはResNet-101)を使用して同様の処理を行います。バックボーンはモデルの目のような役割を果たし、画像をスキャンして重要な細部を捉えます。

画像内の物体は非常に小さい場合も大きい場合もあるため、Mask R-CNNはFeature Pyramid Networkを使用します。これは、モデルが細かなディテールと全体像の両方を確認できるよう、異なる倍率の拡大鏡を使うようなものです。これにより、あらゆるサイズの物体を見逃さずに検出できます。

これらの重要な特徴が抽出されると、モデルは画像内の物体候補の位置特定に進み、さらなる分析の準備を整えます。

物体を含む可能性のある画像領域の提案#

画像から主要な特徴が処理されると、Region Proposal Networkが処理を引き継ぎます。このモデル部分は画像を調べ、物体が含まれている可能性の高い領域を提案します。

これを実現するため、アンカーと呼ばれる物体位置の候補を複数生成します。次にネットワークがこれらのアンカーを評価し、さらなる分析に適した有望な候補を選択します。これにより、画像内のすべての場所を確認するのではなく、注目すべき可能性が最も高い領域だけにモデルの処理を集中できます。

Region Proposal Networkの図

図3. Region Proposal Networkの例。

抽出された特徴の強化#

重要な領域が特定されると、次のステップでは、これらの領域から抽出された詳細を改良します。従来のモデルでは、各領域から特徴を取得するためにROI Pooling(Region of Interest Pooling)という手法を使用していましたが、領域のリサイズ時にわずかな位置ずれが生じることがあり、特に小さい物体や重なり合う物体では効果が低下していました。

Mask R-CNNは、ROI Align(Region of Interest Align)と呼ばれる手法を使用することでこれを改良しています。ROI Poolingのように座標を丸めるのではなく、ROI Alignはバイリニア補間を使用してピクセル値をより正確に推定します。バイリニア補間は、最も近い4つの隣接ピクセルの値を平均して新しいピクセル値を算出する手法で、より滑らかな変化を実現します。これにより特徴が元の画像と適切に位置合わせされ、物体検出とセグメンテーションの精度が向上します。

例えば、サッカーの試合で2人の選手が近くに立っていると、バウンディングボックスが重なって一方の選手がもう一方の選手と誤認されることがあります。ROI Alignは、それぞれの形状を分離した状態で維持することで、2人を区別しやすくします。

Mask R-CNNがROI Alignを使用する仕組みの図

図4。Mask R-CNNはROI Alignを使用します。

物体の分類とマスクの予測#

ROI Alignによる画像処理が完了すると、次のステップでは物体を分類し、その位置を微調整します。モデルは抽出された各領域を調べ、そこに含まれる物体を判断します。さまざまなカテゴリーに確率スコアを割り当て、最も適合するものを選択します。

同時に、物体により適合するようバウンディングボックスを調整します。初期ボックスは最適な位置に配置されていない場合があるため、検出した物体を各ボックスがぴったり囲むようにすることで、精度を向上させます。

最後に、Mask R-CNNは追加のステップとして、各物体の詳細なセグメンテーションマスクを並行して生成します。

Mask R-CNNとリアルタイムアプリケーション#

このモデルが登場した当時、AIコミュニティから大きな注目を集め、ほどなくしてさまざまなアプリケーションで使用されるようになりました。物体をリアルタイムで検出してセグメンテーションできる能力は、さまざまな業界に大きな変化をもたらしました。

例えば、野生動物の絶滅危惧種の追跡は困難な作業です。多くの種が密林の中を移動するため、保全活動家がその動向を追跡するのは容易ではありません。従来の方法では、センサーカメラ、ドローン、衛星画像を使用しますが、これらすべてのデータを手作業で整理するには時間がかかります。誤認識や見落としは、保全活動を遅らせる可能性があります。

Mask R-CNNは、トラの縞模様、キリンの斑点、ゾウの耳の形状などの固有の特徴を認識することで、画像や動画内の動物をより高い精度で検出してセグメンテーションできます。動物が木に部分的に隠れていたり、互いに近くに立っていたりする場合でも、モデルはそれぞれを分離して個別に識別できるため、野生動物のモニタリングをより迅速かつ信頼性の高いものにします。

Mask R-CNNを使用した動物の検出とセグメンテーション

図5. Mask R-CNNを使用した動物の検出とセグメンテーション。

Mask R-CNNの制限事項#

物体検出とセグメンテーションにおける歴史的重要性にもかかわらず、Mask R-CNNにはいくつかの重要な欠点もあります。Mask R-CNNに関連する課題は次のとおりです。

  • 高い計算負荷:高性能なGPUに依存するため、実行コストが高くなり、大量のデータを処理する際に遅くなる可能性があります。
  • 処理速度が遅い:多段階の処理により、YOLOのようなより高速なリアルタイムモデルと比べて処理が遅くなるため、時間制約のあるタスクには適さない場合があります。
  • 高品質なデータへの依存:鮮明で適切にラベル付けされた画像を使用した場合に最も高い性能を発揮します。ぼやけた画像や照明条件の悪い画像では、精度が大幅に低下する可能性があります。
  • 実装が複雑:多段階のアーキテクチャは、特に大規模なデータセットや限られたリソースを扱う場合、セットアップと最適化が難しいことがあります。

Mask R-CNNからUltralytics YOLO11へ#

Mask R-CNNはセグメンテーションタスクに適していましたが、多くの業界では、速度とリアルタイム性能を重視しながらコンピュータービジョンを導入することが求められていました。この要件から、1回の処理で物体を検出する1ステージモデルが研究者によって開発され、効率が大幅に向上しました。

Mask R-CNNの多段階処理とは異なり、YOLO(You Only Look Once)のような1ステージのコンピュータービジョンモデルは、リアルタイムのコンピュータービジョンタスクに重点を置いています。検出とセグメンテーションを別々に処理するのではなく、YOLOモデルは画像を一度の処理で分析できます。そのため、高速な意思決定が重要な自動運転、医療、製造、ロボティクスなどのアプリケーションに適しています。

特にUltralytics YOLO11は、高速性と精度を両立することで、これをさらに一歩進めています。YOLOv8mよりパラメーター数が22%少ないにもかかわらず、COCOデータセットでより高い平均適合率(mAP)を達成しており、より正確に物体を検出できます。処理速度も向上しているため、1ミリ秒も無駄にできないリアルタイムアプリケーションに適しています。

他のモデルと比較したUltralytics YOLO11の性能

図6。他のモデルと比較したYOLO11の性能。

主なポイント#

コンピュータービジョンの歴史を振り返ると、Mask R-CNNは物体検出とセグメンテーションにおける大きなブレークスルーとして認識されています。詳細な多段階処理により、複雑な環境でも非常に高い精度の結果を提供します。

しかし、同じ処理によって、YOLOのようなリアルタイムモデルと比べて速度が遅くなります。速度と効率性への需要が高まるにつれ、現在では多くのアプリケーションが、迅速かつ正確な物体検出を提供するUltralytics YOLO11のような1ステージモデルを使用しています。Mask R-CNNはコンピュータービジョンの進化を理解するうえで重要ですが、リアルタイムソリューションへの移行は、より迅速で効率的なコンピュータービジョンソリューションに対する需要の高まりを示しています。

成長を続けるコミュニティに参加しませんか?GitHubリポジトリでAIについて詳しく学びましょう。独自のコンピュータービジョンプロジェクトを始める準備はできていますか?ライセンスオプションをご確認ください。AI in agriculturehealthcareにおけるビジョンAIについては、ソリューションページをご覧ください。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る

AIの未来を一緒に築きましょう!

機械学習の未来への歩みを始めましょう