Mask R-CNNとは何か、その仕組みとは?
Mask R-CNNを使用して画像や動画内のオブジェクトを高精度にセグメンテーションし、さまざまな業界の多様な用途に活用する方法を解説します。

AIの導入が進むにつれて、倉庫内のロボット、混雑した道路を安全に走行する自動運転車、作物を確認するドローン、工場で製品を検査するAIシステムなどのイノベーションが、ますます一般的になっています。こうしたイノベーションを支える重要なテクノロジーがコンピュータービジョンです。これは、機械が視覚データを理解して解釈できるようにするAIの一分野です。
例えば、物体検出は、バウンディングボックスを使用して画像内の物体を識別し、その位置を特定するコンピュータービジョンのタスクです。バウンディングボックスは有用な情報を提供しますが、物体の位置を大まかに推定するだけで、正確な形状や境界を捉えることはできません。そのため、正確な識別が必要なアプリケーションでは効果が低くなります。
この問題を解決するため、研究者は物体の正確な輪郭を捉え、より精度の高い検出と分析を可能にするピクセルレベルの詳細情報を提供するセグメンテーションモデルを開発しました。
Mask R-CNNは、こうしたモデルの1つです。2017年にFacebook AI Research(FAIR)によって発表され、R-CNN、Fast R-CNN、Faster R-CNNなどの従来のモデルを基盤としています。コンピュータービジョンの歴史における重要なマイルストーンとして、Mask R-CNNはUltralytics YOLO11など、より高度なモデルへの道を切り開きました。
この記事では、Mask R-CNNとは何か、その仕組みや用途、そしてUltralytics YOLO11へとつながる、その後の改良について説明します。
Mask R-CNNの概要#
Mask R-CNNはMask Region-based Convolutional Neural Networkの略で、物体検出やインスタンスセグメンテーションなどのコンピュータービジョンタスク向けに設計された深層学習モデルです。
インスタンスセグメンテーションは、画像内の物体を識別するだけでなく、それぞれの輪郭を正確に描画することで、従来の物体検出を上回ります。検出したすべての物体に固有のラベルを付与し、ピクセルレベルで正確な形状を捉えます。この詳細なアプローチにより、重なり合う物体を明確に区別し、複雑な形状にも正確に対応できます。
Mask R-CNNは、物体を検出してラベル付けする一方で、正確な形状までは定義しないFaster R-CNNを基盤としています。Mask R-CNNは、各物体を構成する正確なピクセルを特定することでこれを改良し、より詳細で精度の高い画像分析を可能にします。

図1. 物体検出とインスタンスセグメンテーションの比較。
Mask R-CNNのアーキテクチャと仕組み#
Mask R-CNNは、物体を正確に検出してセグメンテーションするため、段階的なアプローチを取ります。まず、ディープニューラルネットワーク(データから学習する多層モデル)を使用して主要な特徴を抽出し、次にリージョンプロポーザルネットワーク(物体が存在する可能性の高い領域を提案するコンポーネント)で物体候補の領域を特定し、最後に詳細なセグメンテーションマスク(物体の正確な輪郭)を作成して、これらの領域を改良します。
次に、Mask R-CNNの仕組みをより深く理解するため、各ステップを順に見ていきます。

図2. Mask R-CNNのアーキテクチャの概要(出典:researchgate.net)。
特徴抽出から始める#
Mask R-CNNのアーキテクチャにおける最初のステップは、モデルが画像の内容を理解できるよう、画像を主要な部分に分解することです。写真を見るときに、形状や色、エッジなどの細部に自然と気づくのと同じようなものです。モデルは「バックボーン」と呼ばれるディープニューラルネットワーク(多くの場合、ResNet-50またはResNet-101)を使用して同様の処理を行います。バックボーンはモデルの目のような役割を果たし、画像をスキャンして重要な細部を捉えます。
画像内の物体は非常に小さい場合も大きい場合もあるため、Mask R-CNNはFeature Pyramid Networkを使用します。これは、モデルが細かなディテールと全体像の両方を確認できるよう、異なる倍率の拡大鏡を使うようなものです。これにより、あらゆるサイズの物体を見逃さずに検出できます。
これらの重要な特徴が抽出されると、モデルは画像内の物体候補の位置特定に進み、さらなる分析の準備を整えます。
物体を含む可能性のある画像領域の提案#
画像から主要な特徴が処理されると、Region Proposal Networkが処理を引き継ぎます。このモデル部分は画像を調べ、物体が含まれている可能性の高い領域を提案します。
これを実現するため、アンカーと呼ばれる物体位置の候補を複数生成します。次にネットワークがこれらのアンカーを評価し、さらなる分析に適した有望な候補を選択します。これにより、画像内のすべての場所を確認するのではなく、注目すべき可能性が最も高い領域だけにモデルの処理を集中できます。

図3. Region Proposal Networkの例。
抽出された特徴の強化#
重要な領域が特定されると、次のステップでは、これらの領域から抽出された詳細を改良します。従来のモデルでは、各領域から特徴を取得するためにROI Pooling(Region of Interest Pooling)という手法を使用していましたが、領域のリサイズ時にわずかな位置ずれが生じることがあり、特に小さい物体や重なり合う物体では効果が低下していました。
Mask R-CNNは、ROI Align(Region of Interest Align)と呼ばれる手法を使用することでこれを改良しています。ROI Poolingのように座標を丸めるのではなく、ROI Alignはバイリニア補間を使用してピクセル値をより正確に推定します。バイリニア補間は、最も近い4つの隣接ピクセルの値を平均して新しいピクセル値を算出する手法で、より滑らかな変化を実現します。これにより特徴が元の画像と適切に位置合わせされ、物体検出とセグメンテーションの精度が向上します。
例えば、サッカーの試合で2人の選手が近くに立っていると、バウンディングボックスが重なって一方の選手がもう一方の選手と誤認されることがあります。ROI Alignは、それぞれの形状を分離した状態で維持することで、2人を区別しやすくします。

図4。Mask R-CNNはROI Alignを使用します。
物体の分類とマスクの予測#
ROI Alignによる画像処理が完了すると、次のステップでは物体を分類し、その位置を微調整します。モデルは抽出された各領域を調べ、そこに含まれる物体を判断します。さまざまなカテゴリーに確率スコアを割り当て、最も適合するものを選択します。
同時に、物体により適合するようバウンディングボックスを調整します。初期ボックスは最適な位置に配置されていない場合があるため、検出した物体を各ボックスがぴったり囲むようにすることで、精度を向上させます。
最後に、Mask R-CNNは追加のステップとして、各物体の詳細なセグメンテーションマスクを並行して生成します。
Mask R-CNNとリアルタイムアプリケーション#
このモデルが登場した当時、AIコミュニティから大きな注目を集め、ほどなくしてさまざまなアプリケーションで使用されるようになりました。物体をリアルタイムで検出してセグメンテーションできる能力は、さまざまな業界に大きな変化をもたらしました。
例えば、野生動物の絶滅危惧種の追跡は困難な作業です。多くの種が密林の中を移動するため、保全活動家がその動向を追跡するのは容易ではありません。従来の方法では、センサーカメラ、ドローン、衛星画像を使用しますが、これらすべてのデータを手作業で整理するには時間がかかります。誤認識や見落としは、保全活動を遅らせる可能性があります。
Mask R-CNNは、トラの縞模様、キリンの斑点、ゾウの耳の形状などの固有の特徴を認識することで、画像や動画内の動物をより高い精度で検出してセグメンテーションできます。動物が木に部分的に隠れていたり、互いに近くに立っていたりする場合でも、モデルはそれぞれを分離して個別に識別できるため、野生動物のモニタリングをより迅速かつ信頼性の高いものにします。

図5. Mask R-CNNを使用した動物の検出とセグメンテーション。
Mask R-CNNの制限事項#
物体検出とセグメンテーションにおける歴史的重要性にもかかわらず、Mask R-CNNにはいくつかの重要な欠点もあります。Mask R-CNNに関連する課題は次のとおりです。
- 高い計算負荷:高性能なGPUに依存するため、実行コストが高くなり、大量のデータを処理する際に遅くなる可能性があります。
- 処理速度が遅い:多段階の処理により、YOLOのようなより高速なリアルタイムモデルと比べて処理が遅くなるため、時間制約のあるタスクには適さない場合があります。
- 高品質なデータへの依存:鮮明で適切にラベル付けされた画像を使用した場合に最も高い性能を発揮します。ぼやけた画像や照明条件の悪い画像では、精度が大幅に低下する可能性があります。
- 実装が複雑:多段階のアーキテクチャは、特に大規模なデータセットや限られたリソースを扱う場合、セットアップと最適化が難しいことがあります。
Mask R-CNNからUltralytics YOLO11へ#
Mask R-CNNはセグメンテーションタスクに適していましたが、多くの業界では、速度とリアルタイム性能を重視しながらコンピュータービジョンを導入することが求められていました。この要件から、1回の処理で物体を検出する1ステージモデルが研究者によって開発され、効率が大幅に向上しました。
Mask R-CNNの多段階処理とは異なり、YOLO(You Only Look Once)のような1ステージのコンピュータービジョンモデルは、リアルタイムのコンピュータービジョンタスクに重点を置いています。検出とセグメンテーションを別々に処理するのではなく、YOLOモデルは画像を一度の処理で分析できます。そのため、高速な意思決定が重要な自動運転、医療、製造、ロボティクスなどのアプリケーションに適しています。
特にUltralytics YOLO11は、高速性と精度を両立することで、これをさらに一歩進めています。YOLOv8mよりパラメーター数が22%少ないにもかかわらず、COCOデータセットでより高い平均適合率(mAP)を達成しており、より正確に物体を検出できます。処理速度も向上しているため、1ミリ秒も無駄にできないリアルタイムアプリケーションに適しています。

図6。他のモデルと比較したYOLO11の性能。
主なポイント#
コンピュータービジョンの歴史を振り返ると、Mask R-CNNは物体検出とセグメンテーションにおける大きなブレークスルーとして認識されています。詳細な多段階処理により、複雑な環境でも非常に高い精度の結果を提供します。
しかし、同じ処理によって、YOLOのようなリアルタイムモデルと比べて速度が遅くなります。速度と効率性への需要が高まるにつれ、現在では多くのアプリケーションが、迅速かつ正確な物体検出を提供するUltralytics YOLO11のような1ステージモデルを使用しています。Mask R-CNNはコンピュータービジョンの進化を理解するうえで重要ですが、リアルタイムソリューションへの移行は、より迅速で効率的なコンピュータービジョンソリューションに対する需要の高まりを示しています。
成長を続けるコミュニティに参加しませんか?GitHubリポジトリでAIについて詳しく学びましょう。独自のコンピュータービジョンプロジェクトを始める準備はできていますか?ライセンスオプションをご確認ください。AI in agricultureとhealthcareにおけるビジョンAIについては、ソリューションページをご覧ください。









