Panoptic Segmentation
セマンティックセグメンテーションとインスタンスセグメンテーションを統合するパノプティックセグメンテーションを探求します。Ultralytics YOLO26がAIプロジェクトのためにどのように正確なシーン理解を実現するかを学びましょう。
パノプティックセグメンテーションは、画像解析における2つの異なる形態であるセマンティックセグメンテーションとインスタンスセグメンテーションを統合する、包括的なコンピュータビジョン (CV)タスクです。従来の手法では、「空」や「草」といった背景領域を一般的なものとして分類するか、「車」や「人」といった特定のオブジェクトを検出し、「車」や「人」といった特定のオブジェクトを検出するといったように、これら2つのタスクを別個のものとして扱っていましたが、パノプティックセグメンテーションはこれらを1つのまとまりのあるフレームワークに統合します。このアプローチにより、画像内のすべてのピクセルに一意の値が割り当てられ、数えられるオブジェクト(「Things」と呼ばれる)と定型的な背景領域(「Stuff」と呼ばれる)を区別する、完全なシーン理解が提供されます。すべてのピクセルが網羅され分類されることを保証することで、この手法は孤立した検出手法よりも人間の視覚認知に密接に似せた動作を実現します。
中心となる概念:背景 (Stuff) と もの (Things)#
パノプティックセグメンテーションを完全に理解するためには、それが処理する視覚情報の二分法について知ることが役立ちます。このタスクは視覚世界を主に2つのカテゴリーに分類します。
- Stuff カテゴリ: これらは、数えることができない、同様のテクスチャや材質を持つ不定形な領域を表します。例としては、道路、水、草、空、壁などが挙げられます。パノプティック解析では、「道路セグメントA」と「道路セグメントB」を区別することは一般的に意味がないため、「道路」に属するすべてのピクセルが1つのセマンティック領域にグループ化されます。
- Things カテゴリ: これらは、明確な幾何学形状と境界を持つ、数えられるオブジェクトです。例としては、歩行者、車両、動物、道具などが挙げられます。パノプティックモデルでは、各「Thing」をそれぞれ固有のエンティティとして識別し、並んで立つ2人の人物がマージされた塊ではなく、個別のインスタンス(例:「人物A」と「人物B」)として確実に認識されるようにする必要があります。
この区別は、高度な人工知能 (AI)システムにとって極めて重要であり、特定のオブジェクトとインタラクションしながら環境内をナビゲートすることを可能にします。
パノプティックアーキテクチャの仕組み#
現代のパノプティックセグメンテーションのアーキテクチャでは通常、画像から豊富な特徴表現を抽出するために、畳み込みニューラルネットワーク (CNN)やビジョン・トランスフォーマー (ViT)などの強力なディープラーニング (DL)バックボーンが採用されています。ネットワークは一般的に2つのブランチ(または「ヘッド」)に分岐します。
-
セマンティックヘッド: このブランチはすべてのピクセルに対してクラスラベルを予測し、シーン内の「背景」に関する高密度なマップを生成します。
-
インスタンスヘッド: 同時に、このブランチはオブジェクト検出と同様の手法を使用して「Things」の位置を特定し、それらのマスクを生成します。
その後、フュージョンモジュールや後処理ステップによって、これらの出力間の競合(たとえば、ピクセルが「人物」のインスタンスに属するのか、その後ろにある「背景」の壁に属するのかの決定など)が解決され、最終的な重なり合わないパノプティックセグメンテーションマップが生成されます。
実社会での応用#
パノプティックセグメンテーションが持つ全体論的な性質は、安全性や状況把握が最優先される業界において不可欠なものとなっています。
- 自動運転車: 自動運転車は、安全にナビゲートするためにパノプティック知覚に依存しています。セマンティックコンポーネントが走行可能な表面(道路)と境界(歩道)を識別し、インスタンスコンポーネントが歩行者や他の車両などの動的な障害物を追跡します。この統合されたビューにより、車両のプランニングアルゴリズムは複雑な交通管理のシナリオにおいて、より安全な決定を下すことができます。
- 医療画像解析: デジタル病理学において、組織サンプルの解析では、一般的な組織構造(Stuff)をセグメンテーションすると同時に、特定の細胞タイプや腫瘍(Things)をカウントして測定することが求められることがよくあります。この詳細な内訳により、医師は正確な疾患の定量化と診断を行うことができます。
- ロボティクス: 家庭や倉庫などの構造化されていない環境で動作するサービスロボットは、走行可能な床(背景)と、操作または回避すべきオブジェクト(インスタンス)を区別する必要があります。
Ultralyticsによるセグメンテーションの実装#
完全なパノプティックトレーニングは複雑になる場合がありますが、開発者はUltralytics YOLO26を使用することで、パノプティックパズルの重要な構成要素である高精度なインスタンスセグメンテーションを実現できます。この最先端モデルはリアルタイム性能を提供し、エッジ展開向けに最適化されています。
以下のPythonの例では、事前トレーニング済みのセグメンテーションモデルを読み込み、推論を実行して個別の物体を分離する方法を示します。
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image to segment individual instances
# The model identifies 'things' and generates pixel-perfect masks
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with overlaid segmentation masks
results[0].show()トレーニングデータの管理とアノテーションプロセスの自動化を目指すチームのために、Ultralytics Platformはデータセット管理とモデルトレーニングのためのツールスイートを提供します。モデルが効果的に学習するには正確なピクセル単位のラベルが必要となるため、高品質なデータアノテーションはセグメンテーションタスクにおいて極めて重要です。
関連用語の区別#
プロジェクトに適したモデルを選択するには、セグメンテーションタイプの違いを理解することが不可欠です。
- セマンティックセグメンテーション: ピクセルをカテゴリに分類することだけに焦点を当てます。「このピクセルはどのクラスですか?」(例:木、空)という問いに答えますが、同じクラスの個々のオブジェクトを分離することはできません。2台の車が重なっている場合、それらは1つの大きな「車」の塊として表示されます。
- インスタンスセグメンテーション: 数えられるオブジェクトの検出とマスク生成だけに焦点を当てます。「これはどのオブジェクトですか?」という問いに答えますが、通常、背景コンテキストは完全に無視されます。
- パノプティックセグメンテーション: 両者を組み合わせたものです。「これは何のピクセルか?」そして「それはどのオブジェクトインスタンスに属するか?」という問いに画像全体に対して答え、どのピクセルも分類漏れがないようにします。
これらのタスクで使用されるデータセット形式についてさらに詳しく調べるには、セグメンテーション性能を測定するための標準的なベンチマークであるCOCO データセットのドキュメントを確認してください。






