インスタンスセグメンテーションとは?クイックガイド
インスタンスセグメンテーションとは何か、その仕組み、さまざまなコンピュータービジョンアプリケーションでの用途、そしてその影響について詳しく解説します。

コンピュータービジョンのアプリケーションは、道路状況を監視する交通カメラから店舗のセルフレジシステムまで、私たちの日常生活でますます一般的になっています。機械が人間と同様の方法で視覚データを理解できるようにすることで、ビジョンAIはさまざまな業界に影響を与えています。
これらのアプリケーションの多くは、画像内の主要なオブジェクトの周囲にバウンディングボックスを配置するコンピュータービジョンタスクである物体検出に依存しています。このアプローチは多くの場合うまく機能しますが、より高い精度を必要とする画像分析ソリューションもあります。
例えば、医療画像では腫瘍を検出するだけでは不十分で、正確な形状の輪郭を描くことが重要です。同様に、ロボティクスでは、機械が物体を正しくつかむために、その正確な輪郭を認識する必要があります。こうした課題に対応するため、インスタンスセグメンテーションはより精密なソリューションを提供します。
インスタンスセグメンテーションは、物体の検出だけでは不十分なユースケースを支援するために設計されたコンピュータービジョンタスクであり、ピクセルレベルの精度を提供します。Ultralytics YOLO11などのコンピュータービジョンモデルを使用すると、画像や動画にインスタンスセグメンテーションを簡単に適用できます。

図1. YOLO11を使用したインスタンスセグメンテーションの例。
このガイドでは、インスタンスセグメンテーションの仕組みや用途、そして特定のセグメンテーションタスク向けにUltralytics YOLO11をカスタムトレーニングする方法を詳しく説明します。
インスタンスセグメンテーションとは?#
人々が近い距離で立っている集合写真があるとします。物体検出を使えば各人の周囲にボックスを描けますが、それぞれの正確な形状までは分かりません。
一方、インスタンスセグメンテーションは、重なっている場合でも全体の輪郭が分かるように、一人ひとりの周囲を丁寧になぞることに似ています。単にボックスで物体の位置を示すのではなく、各物体の正確な形状をピクセルレベルで特定するため、複雑な画像を理解しやすくなります。
その結果、物体の形状を塗りつぶした詳細なマスクが生成され、どのピクセルがその物体に属するかを正確に特定できます。この精度は、物体の正確な形状や境界の理解が重要となる多くの実環境のアプリケーションで役立ちます。

図2. Ultralytics YOLO11のインスタンスセグメンテーション対応の紹介。
インスタンスセグメンテーションとセマンティックセグメンテーションの比較#
インスタンスセグメンテーションについて調べていると、セマンティックセグメンテーションという概念を目にすることがあります。
どちらの手法もコンピューターが画像をピクセルレベルで理解するのに役立ちますが、目的は異なります。セマンティックセグメンテーションは、カテゴリに基づいてすべてのピクセルにラベルを付け、同じ種類のすべての物体をまとめます。例えば、複数の車が写った画像では、個々の車両を区別せず、すべてを「car」として識別します。
一方、インスタンスセグメンテーションは一歩進んで、各物体を個別に特定します。個々のインスタンスに固有のラベルを割り当て、その形状の周囲に正確なマスクを作成します。つまり同じ画像で、すべてを単に「car」とラベル付けするのではなく、各車を個別に認識して輪郭を描きます。
両者の主な違いは、セマンティックセグメンテーションがカテゴリごとに物体をまとめるのに対し、インスタンスセグメンテーションは明確な境界を持つ固有のエンティティとして各物体を区別する点です。どちらのタスクを使用するかは、画像内に何があるか分かれば十分なのか、それとも個々の物体を区別することが重要なのかなど、具体的なアプリケーションによって決まります。

図3. インスタンスセグメンテーションとセマンティックセグメンテーションの比較(それぞれ右と左)。
人気のインスタンスセグメンテーションモデル#
現在、ビジョンAIコミュニティではさまざまなインスタンスセグメンテーションモデルを利用できます。高速なモデル、より高精度なモデル、使いやすいモデルなど、それぞれに特徴があります。
これらの選択肢は便利である一方、特定のタスクに適したモデルはどれかという疑問につながることがあります。選択肢の中でも、Ultralytics YOLOモデルは速度と精度を重視しているため、非常に人気があります。
また、これらのモデルは長年にわたって大きく進化してきました。例えば、Ultralytics YOLOv5はPyTorchなどのフレームワークを使用してデプロイを簡素化し、高度な技術的専門知識を必要とせずに、より幅広いユーザーが先進的なビジョンAIを利用できるようにしました。
その成功を基盤として、Ultralytics YOLOv8はインスタンスセグメンテーション、姿勢推定、画像分類などのコンピュータービジョンタスクへの対応を強化しました。
現在、Ultralytics YOLO11はパフォーマンスを新たなレベルに引き上げています。YOLOv8mより22%少ないパラメーターでCOCOデータセットにおける平均適合率(mAP)が高く、より少ないリソースで物体をより正確に認識できます。

図4. YOLO11のベンチマーク。
簡単に言えば、Ultralytics YOLO11は効率性を損なうことなく最先端の精度を実現し、この分野に大きな変革をもたらしています。
インスタンスセグメンテーションの仕組みを理解する#
次に、インスタンスセグメンテーションが一般的にどのように機能するかを見ていきましょう。従来のコンピュータービジョンモデルは、2段階のアプローチを使用します。
まず、物体の周囲にバウンディングボックスを描いて物体を検出します。次に、ピクセルレベルのマスクを生成して各物体の正確な形状の輪郭を描きます。よく知られた例としてMask R-CNNがあり、物体検出モデルを基盤にマスク予測のステップを追加しています。この手法は効果的ですが、画像を複数の段階で処理するため低速になる可能性があり、リアルタイムアプリケーションをより難しくします。
一方、Ultralytics YOLO11などのモデルは画像を一度に処理し、物体のバウンディングボックスとインスタンスセグメンテーションマスクを同時に予測します。この効率化されたアプローチにより、高い精度を維持しながら大幅に高速化できます。そのため、速度と精度の両方が重要な自動運転、動画分析、ロボティクスなどのリアルタイムアプリケーションに特に適しています。
インスタンスセグメンテーション向けUltralytics YOLO11のカスタムトレーニング#
YOLO11は、すぐに使用できる状態では事前トレーニング済みモデルとして提供されます。インスタンスセグメンテーション向けの日常的な物体を網羅するCOCO-Segデータセットでトレーニングされています。ただし、Ultralytics Pythonパッケージはカスタムトレーニングに対応しており、固有の物体をセグメンテーションする必要がある専門的なアプリケーションに不可欠です。
モデルのカスタムトレーニングやファインチューニングが重要なのはなぜでしょうか。カスタムトレーニングでは、事前トレーニング済みモデルにすでに組み込まれている知識を基盤として、転移学習を活用します。ゼロから始めるのではなく、より小規模なデータセットと少ない計算リソースで既存モデルを新しいタスクに適応させながら、高い精度を維持できます。
Ultralytics YOLO11をカスタムトレーニングする方法#
ここでは、インスタンスセグメンテーション向けにUltralytics YOLO11をファインチューニングする手順を詳しく見ていきます。
- データ準備: 特定のアプリケーションに基づいて画像を収集し、アノテーションを付けます。Ultralyticsは複数の画像データセットに対応していますが、必要なYOLO形式で画像とアノテーションを準備すれば、独自のデータセットを使ってトレーニングすることもできます。
- 事前トレーニング済みモデルの使用: ゼロから始めるのではなく、事前トレーニング済みのUltralytics YOLO11モデルを使用します。
- モデルのトレーニング: バッチサイズ(イテレーションごとに処理する画像数)、画像サイズ(目標入力解像度)、エポック数(トレーニングサイクルの合計)などの重要なトレーニング設定を調整し、モデルをトレーニングします。
- パフォーマンス評価: モデルのトレーニングが完了したら、mAPなどのパフォーマンス指標を使用してモデルの精度をテストできます。Ultralytics Pythonパッケージには、モデル評価用の組み込み関数も用意されています。
Ultralytics YOLO11で実現するインスタンスセグメンテーションのアプリケーション#
インスタンスセグメンテーションは、機械が物体をより正確に認識・理解できるようにすることで、実世界の課題の解決に利用できます。自動化の改善から環境保護まで、さまざまな分野で重要な役割を果たしています。ここでは、インスタンスセグメンテーションが影響を与えている分野の例をいくつか紹介します。
Ultralytics YOLO11を使用した建設現場の安全管理と監視#
インスタンスセグメンテーションは、建設現場の安全性と効率性を確保するうえで重要な役割を果たします。例えば、重機の監視に利用できます。
Ultralytics YOLO11は、クレーン、掘削機、ブルドーザーなど、さまざまな種類の設備を正確にセグメンテーションして識別し、その位置をリアルタイムで追跡できるようにファインチューニングできます。これにより現場管理者は、重機が指定区域内で厳密に稼働し、作業員がいる区域や危険が存在する区域に侵入していないことを確認できます。
さらに、このようなソリューションをリアルタイム警告システムと統合することで、迅速な是正措置を講じられます。これに加えて、収集したインサイトは現場のレイアウトやワークフローの最適化に役立ち、リスクをさらに低減し、生産性を高めます。

図5. Ultralytics YOLO11を使用した重機の監視。
セグメンテーションとUltralytics YOLO11による動物の監視#
動物行動の監視は、研究者、農家、自然保護活動家がさまざまな環境で動物をより適切に管理するのに役立ちます。インスタンスセグメンテーションは、農場、動物園、自然生息地にいる個々の動物を識別してセグメンテーションすることで、こうしたシステムに役立ちます。バウンディングボックスを使用する従来の物体検出とは異なり、インスタンスセグメンテーションは各動物をピクセルレベルで区切るため、動物同士が近接している場合に特に有用です。
詳細なセグメンテーションにより、動きや行動をより正確に追跡できます。重なっている動物や密集している動物も明確に認識でき、相互作用、健康状態、活動パターンをより正確に分析できます。全体として、動物行動に関するより深いインサイトは、動物のケアや管理方法の向上につながります。

図6. インスタンスセグメンテーションを使用した牛の監視。
スポーツ分析と選手追跡におけるUltralytics YOLO11#
選手やイベントを正確に追跡することは、スポーツ分析の大きな部分を占めます。従来の追跡方法は手動タグ付けに依存しているため、詳細な相互作用を捉えられない場合があります。コンピュータービジョンを使用すると、各選手、ボール、重要なイベントなどの詳細をピクセルレベルでセグメンテーションし、詳細なインサイトを得られます。
例えば、インスタンスセグメンテーションは、各選手と物体を明確に分離することで、ファウルやボールのない場所での出来事などのイベント検出に役立ちます。Ultralytics YOLO11などのモデルによるこのきめ細かな監視により、分析担当者は動作パターン、空間的位置関係、相互作用を高精度で研究するための、より明確な情報を得られます。こうしたインサイトの主な利点は、チームが戦略を改善し、全体的なパフォーマンスを高められることです。
インスタンスセグメンテーションのメリットとデメリット#
インスタンスセグメンテーションがさまざまな業界にもたらす主なメリットをいくつか紹介します。
- 自動化の改善: 品質管理や安全監視などのタスクを自動化することで、インスタンスセグメンテーションは手動介入の必要性を減らし、人為的ミスを最小限に抑えます。
- シーン理解の向上: 各物体の輪郭を正確に描くことで、インスタンスセグメンテーションは複雑なシーンのより深い理解に貢献し、より十分な情報に基づく意思決定を支援します。
- 後処理の効率化: ピクセルレベルの出力により、背景除去、物体カウント、空間分析などのタスクが簡素化され、追加の処理ステップの必要性が減ります。
これらのメリットは、インスタンスセグメンテーションがさまざまなユースケースに与える影響を示していますが、実装に伴う課題も考慮することが重要です。
インスタンスセグメンテーションの主な制限事項をいくつか紹介します。
- 透明性に関する課題: ガラスや水などの透明または反射する物体のセグメンテーションは難しく、境界が不正確になる可能性があります。
- メンテナンスの負担: モデルの精度と関連性を維持するには、環境条件やデータセットの変化に応じて、継続的な更新とファインチューニングが必要です。
- 高いアノテーション作業量: インスタンスセグメンテーションモデルのトレーニングには詳細なピクセルレベルのアノテーションが必要であり、データ準備にかかる時間とコストが大幅に増加します。
主なポイント#
インスタンスセグメンテーションにより、物体が重なっている場合でも、個々の物体を正確に区別できます。物体の境界をピクセルレベルで捉えることで、物体検出などの従来のコンピュータービジョンタスクと比べて、視覚データをより深く理解できます。
コンピュータービジョンの最近の進歩により、インスタンスセグメンテーションはより高速で使いやすくなっています。特に、Ultralytics YOLO11などのコンピュータービジョンモデルはプロセスを簡素化し、最小限のセットアップでリアルタイムセグメンテーションを可能にすることで、さまざまな業界やアプリケーションで利用しやすくしています。
AIに興味がありますか?GitHubリポジトリにアクセスし、コミュニティに参加して、探索を続けてください。自動運転車におけるAIや農業におけるビジョンAIなどのイノベーションについては、ソリューションページをご覧ください。ライセンスオプションを確認して、コンピュータービジョンプロジェクトを始めましょう。









