Panoptic Segmentation
パノプティックセグメンテーションがセマンティックセグメンテーションとインスタンスセグメンテーションを統合する方法を確認します。Ultralytics YOLO26がAIプロジェクトで正確なシーン理解を実現する方法を学びます。
パノプティックセグメンテーションは、2種類の異なる画像分析、すなわちセマンティックセグメンテーションとインスタンスセグメンテーションを統合する、包括的なコンピュータビジョン(CV)タスクです。従来の手法では、これらのタスクを別々に扱います。つまり、「空」や「草」のような背景領域を一般的に分類するか、「車」や「人」のような特定の物体を検出します。一方、パノプティックセグメンテーションでは、これらを単一の一貫したフレームワークに統合します。この手法では、画像内のすべてのピクセルに固有の値を割り当て、数えられる物体(「things」と呼ばれます)と、形状が定まらない背景領域(「stuff」と呼ばれます)を区別した、シーン全体の理解を実現します。すべてのピクセルを漏れなく処理して分類することで、この技術は個別に動作する検出手法よりも人間の視覚認知に近い処理を実現します。
中核概念:StuffとThingsの違い#
パノプティックセグメンテーションを十分に理解するには、処理対象となる視覚情報の二分法を理解すると役立ちます。このタスクでは、視覚世界を次の2つの主要カテゴリに分けます。
- Stuffカテゴリ: 数えることができない、類似したテクスチャや素材からなる形状が定まらない領域を表します。道路、水、草、空、壁などが例です。パノプティック分析では、「道路」に属するすべてのピクセルを1つのセマンティック領域にまとめます。これは通常、「道路セグメントA」と「道路セグメントB」を区別することに意味がないためです。
- Thingsカテゴリ: 明確な形状と境界を持つ、数えることができる物体です。歩行者、車両、動物、工具などが例です。パノプティックモデルは、それぞれの「thing」を固有のエンティティとして識別する必要があります。これにより、横並びに立つ2人の人物が、結合した1つの塊ではなく、別々のインスタンス(例:「Person A」と「Person B」)として認識されます。
この区別は、高度な人工知能(AI)システムにとって重要です。これにより、システムは環境内を移動しながら、特定の物体と同時にインタラクションできます。
パノプティックアーキテクチャの仕組み#
最新のパノプティックセグメンテーションアーキテクチャでは通常、畳み込みニューラルネットワーク(CNN)やビジョントランスフォーマー(ViT)などの強力なディープラーニング(DL)バックボーンを使用して、画像から豊富な特徴表現を抽出します。ネットワークは通常、次の2つのブランチ、つまり「ヘッド」に分かれます。
-
セマンティックヘッド: このブランチはすべてのピクセルのクラスラベルを予測し、シーン内の「stuff」の密なマップを生成します。
-
インスタンスヘッド: このブランチは同時に、物体検出と同様の手法を使用して「things」の位置を特定し、それらのマスクを生成します。
その後、フュージョンモジュールまたは後処理ステップがこれらの出力間の競合を解決します。たとえば、あるピクセルが「人」のインスタンスに属するのか、その背後にある「背景」の壁に属するのかを判断し、最終的に重複のないパノプティックセグメンテーションマップを生成します。
実世界での利用例#
パノプティックセグメンテーションは、 safetyとコンテキストが極めて重要な業界に不可欠な、包括的な性質を備えています。
- 自動運転車: 自動運転車は、安全に走行するためにパノプティック知覚に依存しています。セマンティックコンポーネントは走行可能な路面(道路)と境界(歩道)を識別し、インスタンスコンポーネントは歩行者や他の車両などの動的な障害物を追跡します。この統合されたビューにより、複雑な交通管理シナリオにおいて、車両のプランニングアルゴリズムがより安全な判断を下せるようになります。
- 医用画像分析: デジタル病理学では、組織サンプルを分析する際に、一般的な組織構造(stuff)をセグメンテーションすると同時に、特定の細胞種や腫瘍(things)を数えて計測することが求められる場合があります。この詳細な内訳は、医師による正確な疾患の定量化と診断に役立ちます。
- ロボティクス: 家庭や倉庫などの非構造化環境で動作するサービスロボットは、移動可能な床面(背景)と、操作または回避する必要がある物体(インスタンス)を区別する必要があります。
Ultralyticsでセグメンテーションを実装する#
パノプティックセグメンテーションの完全なトレーニングは複雑になる場合がありますが、開発者はパノプティック処理に不可欠な要素である高精度のインスタンスセグメンテーションをUltralytics YOLO26で実現できます。この最先端モデルはリアルタイム性能を提供し、エッジデプロイメント向けに最適化されています。
次のPythonの例では、事前学習済みのセグメンテーションモデルを読み込み、個別の物体を分離するために推論を実行する方法を示します。
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image to segment individual instances
# The model identifies 'things' and generates pixel-perfect masks
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with overlaid segmentation masks
results[0].show()トレーニングデータを管理し、アノテーションプロセスを自動化したいチーム向けに、Ultralytics Platformはデータセット管理とモデルのトレーニングのためのツール一式を提供します。モデルが効果的に学習するにはピクセルレベルで正確なラベルが必要なため、高品質なデータアノテーションはセグメンテーションタスクに不可欠です。
関連用語との違い#
プロジェクトに適したモデルを選択するには、セグメンテーションの種類ごとの違いを理解することが重要です。
- セマンティックセグメンテーション: ピクセルをカテゴリに分類することだけに重点を置きます。「このピクセルは何のクラスか?」(例:木、空)という問いに答えますが、同じクラスに属する個々の物体を分離することはできません。2台の車が重なっている場合、それらは1つの大きな「車」の塊として表示されます。
- インスタンスセグメンテーション: 数えることができる物体の検出とマスク生成だけに重点を置きます。「これはどの物体か?」という問いに答えますが、通常は背景のコンテキストを完全に無視します。
- パノプティックセグメンテーション: 両方を組み合わせます。画像全体について、「このピクセルは何か?」と「このピクセルはどの物体インスタンスに属するか?」という問いに答え、分類されないピクセルが残らないようにします。
これらのタスクで使用されるデータセット形式についてさらに詳しく確認するには、セグメンテーション性能の測定に用いられる標準ベンチマークであるCOCOデータセットのドキュメントを参照してください。









