インスタンスセグメンテーションとは?クイックガイド
インスタンスセグメンテーションとは何か、どのように機能するのか、さまざまなコンピュータビジョンアプリケーションでの使用方法、そしてそれがもたらす影響について詳しく見ていきましょう。

Computer vision のアプリケーションは、道路状況を監視する交通カメラから店舗のセルフレジシステムまで、私たちの日常生活においてますます一般的になっています。機械が人間と同じような方法で視覚データを理解できるようにすることで、ビジョンAIはさまざまな業界に影響を与えています。
これらのアプリケーションの多くはオブジェクト検出に依存しています。これは、画像内の主要なオブジェクトの周囲にバウンディングボックスを配置するcomputer vision taskです。このアプローチはうまく機能することが多いですが、画像分析ソリューションによっては、さらに高い精度が求められる場合もあります。
例えば、医療用画像処理では腫瘍を検出するだけでは不十分であり、その正確な形状を輪郭として抽出することが不可欠です。同様にロボティクス分野でも、機械がオブジェクトを正しく把持するためには、その正確な輪郭を認識する必要があります。これらの課題に対処するために、インスタンスセグメンテーションはより精密なソリューションを提供します。
インスタンスセグメンテーションは、オブジェクトを検出するだけでは不十分なユースケースをサポートするように設計されたコンピュータビジョンタスクであり、ピクセル単位の精度を提供します。Ultralytics YOLO11のようなコンピュータビジョンモデルを使用すると、画像や動画にインスタンスセグメンテーションを簡単に適用できます。

Fig 1. YOLO11をインスタンスセグメンテーションに使用した例。
本ガイドでは、インスタンスセグメンテーションの仕組みとその応用例、そしてUltralytics YOLO11を特定のセグメンテーションタスク向けにカスタムトレーニングする方法について解説します。
インスタンスセグメンテーションとは何か?#
人々が密集して立っている集合写真があるとします。物体検出は各人物の周囲にボックスを描くのに役立ちますが、それだけでは正確な形状まではわかりません。
一方、Instance segmentationは、たとえ人が重なり合っていてもその完全な輪郭を確認できるように、各人物の周囲を慎重になぞるようなものです。単にボックスで何かの位置を示すだけでなく、ピクセル単位で各オブジェクトの正確な形状を特定するため、複雑な画像を理解しやすくなります。
その結果、オブジェクトの形状を塗りつぶし、どのピクセルがそのオブジェクトに属しているかを正確に突き止める詳細なマスクが得られます。このレベルの精度は、オブジェクトの正確な形状や境界を理解することが重要となる多くの実世界のアプリケーションで役立ちます。

図 2: インスタンスセグメンテーションに対する Ultralytics YOLO11 のサポートを示しています。
インスタンスセグメンテーションとセマンティックセグメンテーションの違い#
インスタンスセグメンテーションについて調査する中で、semantic segmentationという概念に出会うかもしれません。
どちらの技術もコンピュータがピクセルレベルで画像を理解するのを助けますが、それぞれ異なる目的があります。セマンティックセグメンテーションは、すべてのピクセルをカテゴリに基づいてラベル付けし、同じタイプのオブジェクトをすべてグループ化します。例えば、複数の車が写っている画像の場合、セマンティックセグメンテーションでは個々の車両を区別せずに、すべてを「車」としてマークします。
一方でインスタンスセグメンテーションは、各オブジェクトを個別に識別することで、さらに一歩進んだ処理を行います。個々のインスタンスに固有のラベルを割り当て、その形状の周囲に正確なマスクを作成します。同じ画像であれば、インスタンスセグメンテーションは単にすべてを「車」とラベル付けするのではなく、各車を個別に認識して輪郭を描き出します。
この2つの主な違いは、セマンティックセグメンテーションはカテゴリごとにオブジェクトをグループ化するのに対し、インスタンスセグメンテーションは各オブジェクトを明確な境界を持つ固有のエンティティとして区別する点にあります。どちらのタスクを使用するかは、その画像内に何があるかを把握するだけで十分なのか、あるいは個々のオブジェクトを区別することが重要なのかといった特定のアプリケーションに基づいて選択されます。

Fig 3. インスタンスセグメンテーションとセマンティックセグメンテーション(それぞれ右と左)。
一般的なインスタンスセグメンテーションモデル#
現在、ビジョンAIコミュニティではさまざまなインスタンスセグメンテーションモデルが利用可能です。高速なもの、高精度なもの、使いやすいものなどがあります。
これらの選択肢は便利ですが、特定のタスクにどれを使うべきかという疑問が生じるかもしれません。その中でもUltralytics YOLOモデルは、スピードと精度を重視しているため非常に人気があります。
また、これらのモデルは長年にわたって大幅に進化してきました。たとえば、Ultralytics YOLOv5はPyTorchなどのフレームワークを使用してデプロイを簡素化し、高度な専門知識を必要とせずにより幅広いユーザーが高度なビジョンAIを利用できるようにしました。
その成功を基盤として、Ultralytics YOLOv8では、インスタンスセグメンテーション、姿勢推定、画像分類などのコンピュータビジョンタスクに対するサポートが強化されました。
現在、Ultralytics YOLO11はパフォーマンスを新たなレベルに引き上げます。YOLOv8mと比較して22%少ないパラメータ数でCOCOデータセットにおいてより高い平均精度(mAP)を達成し、より少ないリソースでオブジェクトをより正確に認識できることを意味します。

Fig 4. YOLO11のベンチマーク。
簡単に言うと、Ultralytics YOLO11は効率性を損なうことなく最先端の精度を実現し、この分野のゲームチェンジャーとなっています。
インスタンスセグメンテーションの仕組みを理解する#
次に、インスタンスセグメンテーションが通常どのように機能するかを見ていきましょう。古いcomputer vision modelsは2ステップのアプローチを使用しています。
まず、オブジェクトの周囲にバウンディングボックスを描画して検出します。次に、ピクセル単位のマスクを生成して、各オブジェクトの正確な形状を輪郭として示します。よく知られた例としてMask R-CNNがあります。これは、object detectionモデルにマスク予測ステップを追加して構築されています。この方法は効果的ですが、画像を複数の段階で処理するため処理が遅くなる可能性があり、リアルタイムアプリケーションへの導入がより困難になります。
一方、Ultralytics YOLO11のようなモデルは、画像を一度に処理し、オブジェクトのバウンディングボックスとインスタンスセグメンテーションマスクを同時に予測します。この合理化されたアプローチにより、高い精度を維持しながら大幅な高速化が図れます。その結果、速度と精度の両方が不可欠である、自動運転、ビデオ解析、ロボティクスなどのリアルタイムアプリケーションに特に役立ちます。
インスタンスセグメンテーションに向けた Ultralytics YOLO11 のカスタムトレーニング#
YOLO11は、そのままの状態で事前学習済みモデルとして提供されます。インスタンスセグメンテーション用の日常的なオブジェクトを網羅したCOCO-Seg datasetで学習が行われています。ただし、Ultralytics Pythonパッケージはカスタム学習をサポートしており、一意のオブジェクトをセグメント化する必要がある特殊なアプリケーションにとってこれは不可欠です。
カスタム学習やモデルのファインチューニングが重要なのはなぜでしょうか?Custom trainingは、事前学習済みモデルにすでに組み込まれている知識を活用して、転移学習を利用します。ゼロから始めるのではなく、より小規模なデータセットとより少ない計算リソースを使用して既存のモデルを新しいタスクに適応させ、同時に高い精度を維持します。
Ultralytics YOLO11 をカスタムトレーニングする方法#
インスタンスセグメンテーションのためにUltralytics YOLO11をファインチューニングする際の手順を詳しく見ていきましょう:
- データの準備: 特定のアプリケーションに基づいて画像を収集し、アノテーションを付与します。Ultralyticsは複数のimage datasetsをサポートしていますが、必要なYOLO形式で画像とアノテーションを準備することで、独自のデータセットを使用して学習することもできます。
- 学習済みモデルの使用: ゼロから始めるのではなく、学習済みのUltralytics YOLO11モデルを使用します。
- モデルトレーニング: バッチサイズ(イテレーションごとに処理される画像数)、画像サイズ(ターゲット入力解像度)、エポック数(総トレーニングサイクル数)などの重要なトレーニング設定を調整し、モデルをトレーニングします。
- パフォーマンス評価: モデルトレーニングが完了したら、mAPなどのパフォーマンスメトリクスを使用してモデルの精度をテストできます。Ultralytics Pythonパッケージには、モデル評価のための組み込み関数も用意されています。
Ultralytics YOLO11によって実現するインスタンスセグメンテーションのアプリケーション#
インスタンスセグメンテーションは、機械がより正確にオブジェクトを見て理解することを助けることで、実世界の課題解決に活用できます。自動化の改善から環境保護まで、多くの分野で重要な役割を果たしています。それがどのように影響を与えているかの例をいくつか見ていきましょう。
Ultralytics YOLO11を使用した建設現場の安全性とモニタリング#
インスタンスセグメンテーションは、建設現場の安全性と効率性を確保するための重要な要素となり得ます。例えば、重機の監視に使用できます。
Ultralytics YOLO11はファインチューニングを行うことで、クレーン、ショベルカー、ブルドーザーなどのさまざまな種類の重機を正確にセグメント化および識別し、その位置をリアルタイムで追跡できます。これにより、現場管理者は機械が指定された領域内でのみ稼働し、作業員がいるゾーンや危険が存在するゾーンに侵入していないことを確認できます。
また、このようなソリューションをリアルタイムのアラートシステムと統合することで、迅速な是正措置を講じることが可能になります。さらに、収集した洞察は現場のレイアウトやワークフローを最適化し、リスクのさらなる低減と生産性の向上に寄与します。

Fig 5. Ultralytics YOLO11を使用した重機のモニタリング。
セグメンテーションとUltralytics YOLO11による動物モニタリング#
Animal behavior monitoringは、研究者、農家、保護活動家がさまざまな環境で動物をよりよく世ワリするのに役立ちます。インスタンスセグメンテーションは、農場、動物園、自然の生息地における個々の動物を識別してセグメント化することにより、これらのシステムで役立つ役割を果たします。バウンディングボックスを使用する従来のオブジェクト検出とは異なり、インスタンスセグメンテーションは各動物のピクセル単位の輪郭を提供するため、動物同士が接近している場合に特に便利です。
詳細なセグメンテーションは、動きや行動のより正確な追跡を促進します。重複していたり密集していたりする動物でも個別に認識できるため、相互作用、健康評価、活動パターンのより精密な分析を提供できます。全体として、動物の行動に関するより深い洞察は、動物のケアと管理の実践を強化します。

Fig 6. インスタンスセグメンテーションを使用したウシの監視。
スポーツアナリティクスと選手追跡におけるUltralytics YOLO11#
正確な選手およびイベントの追跡は、スポーツ分析の重要な部分を占めています。従来の追跡手法は手動のタグ付けに依存しており、詳細な相互作用を捉えきれない場合があります。コンピュータビジョンを使用することで、各選手、ボール、主要イベントなどの詳細をピクセルレベルでセグメント化し、詳細な洞察を得ることができます。
例えば、インスタンスセグメンテーションは、各選手やオブジェクトを明確に分離することにより、ファウルやボールのない場所でのインシデントなどの事象を検知するのに役立ちます。Ultralytics YOLO11のようなモデルによって可能になったこのきめ細かいモニタリングにより、アナリストは移動パターン、空間的な位置取り、インタラクションを高精度で調査するためのより明確な情報を得ることができます。こうした洞察の大きな利点は、チームが戦略を洗練させ、全体的なパフォーマンスを向上させるのに役立つ点です。
インスタンスセグメンテーションの長所と短所#
インスタンスセグメンテーションがさまざまな業界にもたらす主な利点をいくつか挙げます。
- 自動化の改善: 品質管理や安全監視といったタスクを自動化することで、インスタンスセグメンテーションは手作業の必要性を減らし、人的ミスを最小限に抑えます。
- シーン理解の向上: 各オブジェクトを正確に輪郭抽出することで、インスタンスセグメンテーションは複雑なシーンのより深い理解に寄与し、より根拠のある意思決定をサポートします。
- 効率的な後処理: ピクセルレベルの出力は、背景の除去、オブジェクトのカウント、空間解析といったタスクを簡素化し、追加の処理ステップの必要性を削減します。
これらの利点はインスタンスセグメンテーションがさまざまなユースケースに与える影響を強調していますが、導入に伴う課題を検討することも不可欠です。
以下は、インスタンスセグメンテーションの主な制限事項です。
- 透明性に関する課題: ガラスや水のような透明または反射性のオブジェクトをセグメント化することは難しく、境界が不正確になる原因となります。
- メンテナンスコスト: モデルを正確かつ関連性の高い状態に保つためには、環境条件やデータセットの変化に応じて継続的な更新とファインチューニングが必要です。
- 高いアノテーション負荷: インスタンスセグメンテーションモデルのトレーニングには詳細なピクセルレベルのアノテーションが必要であり、データの準備にかかる時間とコストが大幅に増加します。
重要なポイント#
インスタンスセグメンテーションは、オブジェクトが重なり合っている場合でも、高い精度で個々のオブジェクトを区別することを可能にします。ピクセルレベルでオブジェクトの境界を捉えることで、物体検出のような従来のコンピュータビジョンのタスクと比較して、視覚データに対するより深い理解を提供します。
最近のコンピュータビジョンの進歩により、インスタンスセグメンテーションはより高速で使いやすくなりました。特にUltralytics YOLO11のようなコンピュータビジョンモデルは、プロセスを簡素化し、最小限のセットアップでリアルタイムのセグメンテーションを実現することで、さまざまな業界やアプリケーションにとってより利用しやすいものとなっています。
AIについて興味がありますか?our GitHub repositoryにアクセスし、our communityに参加して探求を続けましょう。ソリューションページでAI in self-driving carsやvision AI in agricultureなどのイノベーションについて学びましょう。our licensing optionsを確認して、コンピュータビジョンプロジェクトを始めましょう!






