Interactive Segmentation
インタラクティブセグメンテーションが、人間が介在するプロンプトを使用して物体を分離する仕組みを学びます。Ultralytics YOLO26およびUltralytics Platformの活用方法を探究しましょう。
インタラクティブセグメンテーションは、computer visionにおける高度な共同アプローチであり、人間のユーザーがクリック、バウンディングボックス、テキストプロンプトなどの継続的または単発の入力を提供して、AIモデルが画像内の特定のオブジェクトを分離するのをガイドします。完全に自動化された手法とは異なり、このヒューマン・イン・ザ・ループのテクニックにより、ユーザーはセグメント化すべき対象を正確に定義できるため、曖昧な視覚データ、重なり合うオブジェクト、未知のクラスを扱う場合に特に価値があります。ここ数年、基盤モデルの導入によりこのプロセスの速度と精度が劇的に向上し、data annotationや高精度イメージングに欠かせないツールとなっています。
インタラクティブセグメンテーションの仕組み#
その核心において、このワークフローはpromptable concept segmentationに依存しており、モデルがユーザーのガイダンスを解釈してピクセル単位の正確なマスクを生成します。ユーザーは選択したい前景オブジェクトに「ポジティブ」なクリックを配置し、除外したい背景エリアに「ネガティブ」なクリックを配置することがあります。Segment Anything Model (SAM)やその継承であるMeta SAM 3などの高度なモデルは、diverse gesture types [1]、バウンディングボックス、さらにはテキスト記述を受け入れて視覚検索をグラウンディングすることで、これをさらに発展させています。モデルはこれらのプロンプトに基づいて最適な境界を計算し、ユーザーは希望する精度が達成されるまで追加のクリックでマスクを反復的に洗練させることができます。
実社会での応用#
インタラクティブセグメンテーションは、人間の専門知識とAIの効率性を融合させることで、数多くの業界におけるワークフローを変革しています。
- 医療画像処理: AI in healthcareにおいて、医師や放射線科医はインタラクティブなツールを使用して、MRIやCTスキャン内の腫瘍、病変、または特定の内臓を分離します。spatial modeling for medical images [2]に関する研究は、インタラクティブなクリックにより医療専門家がAIの予測を素早く修正できることを示しており、患者の診断に必要な厳格な精度を保証します。
- 地理空間および衛星マッピング: 都市計画者や環境科学者はインタラクティブモデルを使用して、GIS feature extraction [3]を加速させます。複雑な海岸線、農業の境界、または新しいインフラストラクチャを手動でトレースする代わりに、アナリストはいくつかの戦略的なクリックを配置するだけで、正確な地理ポリゴンを即座に生成できます。
- 産業用欠陥検出: AI in manufacturingにおいて、品質管理エンジニアはインタラクティブなプロンプトを使用して製造ライン上の微小な欠陥をハイライトし、モデル全体を再トレーニングすることなく、新しいタイプの欠陥にシステムを動的に適応させることができます。
インタラクティブセグメンテーションとインスタンスセグメンテーションの比較#
どちらの概念もピクセルレベルでオブジェクトを分離する点では同じですが、それぞれ異なる運用の目的を果たします。Instance segmentationは通常、ユーザーの介入なしにUltralytics YOLO26などのモデルが事前に定義されたクラス(例:「車」、「人」、「犬」)を検出し、その輪郭を描画する完全に自動化されたプロセスです。これがどのように機能するかについての詳細は、guide to instance segmentationをご覧ください。
それに対して、インタラクティブセグメンテーションは事前に定義されたクラスに厳密に依存しません。これはクラスに依存しないため、ユーザーが指し示すものを何でもセグメント化でき、Ultralytics Platformのようなツールを使用して新しいオブジェクトを迅速にアノテーションし、カスタムデータセットに追加する必要があるactive learningパイプラインに最適です。
Ultralyticsを使用した例#
PyTorchと ultralytics Pythonパッケージを使用して、独自のプロジェクトにインタラクティブセグメンテーションを簡単に実装できます。この例では、FastSAMを使用して、バウンディングボックスのプロンプトを提供することにより特定のオブジェクトをセグメント化します。
from ultralytics import FastSAM
# Load a pretrained FastSAM model
model = FastSAM("FastSAM-s.pt")
# Perform interactive segmentation using a bounding box prompt [x1, y1, x2, y2]
results = model("path/to/image.jpg", bboxes=[100, 100, 300, 300])
# Display the segmented result on screen
results[0].show()このスニペットは、シンプルな空間プロンプトがどのように直接モデルをガイドして関心領域を切り出すかを示しており、最小限のコードで複雑なimage segmentationタスクを効率化します。






