プロンプト可能なコンセプトセグメンテーションを理解する
プロンプト可能なコンセプトセグメンテーション、その従来手法との違い、YOLOE-26などの関連モデルがオープンボキャブラリー機能を実現する方法を紹介します。

Vision AIは急速に進歩しており、現実世界の環境で画像や動画を分析するために広く利用されています。たとえば、交通管理システムから小売分析まで、さまざまなアプリケーションにコンピュータービジョンモデルが統合されています。
これらのアプリケーションの多くでは、物体検出モデルなどのビジョンモデルが、車両、人、機器など、あらかじめ定義された物体の集合を認識するようにトレーニングされます。トレーニング中、モデルには多数のラベル付きサンプルが示され、それぞれの物体がどのように見えるか、またシーン内で他の物体とどのように区別できるかを学習します。
セグメンテーションタスクでは、モデルはさらに一歩進み、これらの物体の周囲にピクセルレベルで正確な輪郭を生成します。これにより、システムは画像内で各物体が正確にどこに位置しているかを理解できます。
システムがトレーニング対象の物体だけを認識すればよい場合は、これで問題ありません。しかし、現実世界の環境では、そうでないことがほとんどです。
視覚的なシーンは通常、動的に変化します。新しい物体や視覚的なコンセプトが現れ、状況が変化し、ユーザーは元のトレーニング設定に含まれていなかった物体をセグメントしたいと考えることもよくあります。
こうした制限は、セグメンテーションにおいて特に明確になります。Vision AIが進化し続ける中、新しいコンセプトに繰り返し再トレーニングすることなく適応できる、より柔軟なセグメンテーションモデルの必要性が高まっています。これが、プロンプト可能なコンセプトセグメンテーション(PCS)が注目を集めている理由です。
固定された物体カテゴリのリストに依存する代わりに、ユーザーはテキスト、視覚的なプロンプト、またはサンプル画像を使って、セグメントしたい対象を説明できます。これらのモデルは、説明されたコンセプトに一致するすべての領域を、たとえそのコンセプトがトレーニング中に明示的に含まれていなかった場合でも特定してセグメントできます。
この記事では、プロンプト可能なコンセプトセグメンテーションの仕組み、従来のアプローチとの違い、そして現在の利用分野について説明します。
プロンプト可能なコンセプトセグメンテーションとは?#
ほとんどの場合、セグメンテーションモデルは、少数の物体タイプを認識するようにトレーニングされます。これは、Vision AIシステムが特定の物体セットのみを検出してセグメントする必要がある場合に適しています。
しかし、現実世界のアプリケーションでは、視覚的なシーンは動的に変化します。新しい物体が現れ、タスクの要件が変化し、ユーザーは元のラベルセットに含まれていなかったコンセプトをセグメントする必要が生じることもよくあります。通常、こうした状況に対応するには、新しい高品質なデータとアノテーションを収集してモデルを再トレーニングする必要があり、コストが増加し、デプロイが遅くなります。
プロンプト可能なコンセプトセグメンテーションは、固定されたラベルのリストから選ぶのではなく、何を探すべきかをユーザーがモデルに伝えられるようにすることで、この問題を解決します。ユーザーが探している物体や概念を説明すると、モデルは画像内で一致するすべての領域を強調表示します。これにより、ユーザーの意図を画像内の実際のピクセルに結び付けることが容易になります。

図1. セグメンテーションにコンセプトプロンプトを使用する例(出典)
さまざまなタイプのプロンプトによるセグメンテーションの誘導#
プロンプト可能なコンセプトセグメンテーションをサポートするモデルは、さまざまなタイプの入力を受け取れるため柔軟です。つまり、テキストによる説明、視覚的な手がかり、サンプル画像など、モデルに何を探すべきかを伝える方法は複数あります。
それぞれのアプローチを詳しく見てみましょう。
- テキストプロンプト: 「スクールバス」や「腫瘍領域」のような短いフレーズを使って、セグメントするコンセプトを説明できます。モデルは単語の意味を解釈し、一致する領域を特定します。
- 視覚的なプロンプト: 画像内のポイント、ボックス、または大まかなスケッチを手がかりとして使用します。こうした手がかりが探索箇所を誘導し、最終的な境界の形成に役立ちます。
- 画像エグゼンプラー: 参照画像や小さく切り出した画像で、対象のコンセプトを表します。モデルは視覚的に類似した領域を検索し、見た目に基づいてセグメントします。
PCSと従来のセグメンテーションの違い#
プロンプト可能なコンセプトセグメンテーションの仕組みを詳しく説明する前に、まずさまざまな従来の物体セグメンテーション手法と比較してみましょう。
PCSは、オープンボキャブラリーかつプロンプト駆動型のモデルを実現します。プロンプトで説明された新しい概念にも対応できますが、従来のセグメンテーションは対応できません。従来のセグメンテーションアプローチにはいくつかの種類があり、それぞれ異なる前提と制限があります。
従来のセグメンテーションの主な種類をいくつか見てみましょう。
- セマンティックセグメンテーション: 画像内のすべてのピクセルを、道路、建物、人などのカテゴリの一部としてラベル付けします。同じラベルのすべてのピクセルがまとめられるため、モデルは個々の物体インスタンスを分離しません。
- インスタンスセグメンテーション: モデルは個々の物体を特定してセグメントするため、2人の人物や2台の車は別々の対象として扱われます。
- パノプティックセグメンテーション: この手法はセマンティックセグメンテーションとインスタンスセグメンテーションを組み合わせ、背景領域と個々の物体の両方を含む、シーン全体の情報を提供します。
これらのアプローチはすべて、あらかじめ定義された物体カテゴリのリストに依存します。その範囲内では適切に機能しますが、範囲外のコンセプトへの対応は得意ではありません。新しい特定の物体をセグメントする必要がある場合、通常は追加のトレーニングデータとモデルのファインチューニングが必要です。
PCSはこの状況を変えることを目指しています。あらかじめ定義されたカテゴリに縛られる代わりに、推論時に画像内でセグメントしたい対象を説明できます。
PCSモデルの進化#
次に、セグメンテーションモデルがどのようにプロンプト可能なコンセプトセグメンテーションへと進化してきたかを見ていきましょう。
セグメンテーションに転機をもたらした人気の基盤モデルがSAM、すなわちSegment Anything Modelです。2023年に導入されました。あらかじめ定義された物体カテゴリに依存する代わりに、SAMではポイントやバウンディングボックスなどのシンプルな視覚的プロンプトを使って、ユーザーがセグメンテーションを誘導できました。
SAMにより、ユーザーはラベルを選択する必要がなくなりました。物体の位置を示すだけで、モデルがその物体のマスクを生成します。これによりセグメンテーションはより柔軟になりましたが、ユーザーは依然としてモデルに探索箇所を示す必要がありました。
2024年にリリースされたSAM 2は、この考え方を基盤として、より複雑なシーンに対応し、プロンプト可能なセグメンテーションを動画へ拡張しました。主に視覚的なプロンプトでセグメンテーションを誘導しながら、異なる照明条件、物体形状、動きに対する堅牢性を向上させました。
SAM 3モデルは、この進化における最新の段階です。昨年リリースされ、視覚的理解と言語による誘導を組み合わせた統合モデルであり、画像と動画のセグメンテーションタスク全体で一貫した動作を実現します。
SAM 3では、ユーザーはポイントや描画によるプロンプトに限定されません。代わりに、テキストを使ってセグメントしたい対象を説明でき、モデルは画像または動画フレーム内で、その説明に一致する領域を検索します。
セグメンテーションは固定された物体カテゴリではなくコンセプトによって誘導されるため、さまざまなシーンや時間の経過にわたってオープンボキャブラリーを利用できます。実際、SAM 3は、Wikidataなどのソースから導出されたオントロジーを基盤とし、大規模なトレーニングデータによって拡張された、学習済みの大規模なコンセプト空間上で動作します。

図2. SAM 3にプロンプトを入力して単一画像をセグメントする例(出典)
主に幾何学的なプロンプトに依存していた以前のバージョンと比較すると、SAM 3はより柔軟でコンセプト駆動型のセグメンテーションに向けた一歩です。そのため、関心のある物体や概念が変化し、常に事前定義できるとは限らない現実世界のアプリケーションに、より適しています。
プロンプト可能なビジュアルセグメンテーションの仕組みを探る#
では、プロンプト可能なコンセプトセグメンテーションはどのように機能するのでしょうか。これは、大規模な事前トレーニング済みのビジョンモデルとビジョン・ランゲージモデルを基盤としています。これらは、大量の画像コレクションと、多くの場合は画像と対応するテキストでトレーニングされたモデルです。このトレーニングにより、一般的な視覚パターンと意味を学習できます。
PCSモデルの多くはTransformerベースのアーキテクチャを使用します。これは画像全体を一度に処理し、異なる領域同士の関係を理解します。ビジョンTransformerが画像から視覚的特徴を抽出し、テキストエンコーダーが単語をモデルで処理可能な数値表現に変換します。
トレーニング中、これらのモデルは、正確な物体境界を定義するピクセルレベルのマスク、物体のおおよその位置を示すバウンディングボックス、画像に何が写っているかを説明する画像レベルのラベルなど、さまざまなタイプの教師信号から学習できます。異なる種類のラベル付きデータを使ってトレーニングすることで、モデルは細部とより広範な視覚的コンセプトの両方を捉えられるようになります。
推論時、つまりモデルが実際に予測を行う際、PCSはプロンプト駆動型のプロセスに従います。ユーザーは、テキストによる説明、ポイントやボックスなどの視覚的な手がかり、またはサンプル画像を使って指示を与えます。モデルはプロンプトと画像の両方を共有された内部表現または埋め込みにエンコードし、説明されたコンセプトと整合する領域を特定します。
次に、マスクデコーダーがこの共有表現を正確なピクセルレベルのセグメンテーションマスクに変換します。モデルは視覚的特徴と意味を結び付けるため、トレーニング中に明示的に含まれていなかった新しいコンセプトもセグメントできます。
また、プロンプトを調整したり追加の指示を加えたりすることで、出力を改良できる場合も多く、複雑または曖昧なシーンへの対応に役立ちます。この反復的なプロセスにより、デプロイ時の実用的な最適化が可能になります。
プロンプト可能なコンセプトセグメンテーションモデルは通常、未知のコンセプトをどの程度適切にセグメントできるか、また異なるシーンにわたってどの程度堅牢に動作するかによって評価されます。ベンチマークでは、現実世界のデプロイ要件を反映して、マスク品質、汎化性能、計算効率が重視されることがよくあります。
PCSの現実世界でのユースケース#
次に、プロンプト可能なコンセプトセグメンテーションがすでにどこで利用され、実際の影響を生み始めているのかを見てみましょう。
医療画像向けの柔軟な画像セグメンテーション#
医療画像には、多くの生体構造、疾患、スキャンタイプが関係し、新しい症例が日々発生します。従来のセグメンテーションモデルでは、この多様性への対応が困難です。
PCSは、少数の固定的なリストから選ぶのではなく、見つけたい対象を臨床医が説明できるため、この分野に自然に適合します。テキストフレーズや視覚的なプロンプトを使うことで、タスクごとにモデルを再トレーニングすることなく、臓器や関心領域を直接セグメントできます。これにより、多様な臨床ニーズへの対応、手作業によるマスク描画の削減、さまざまな画像タイプへの対応が容易になります。
優れた例の1つがMedSAM-3です。これはSAM 3アーキテクチャを医療画像におけるテキストプロンプト可能なPCS向けに適応したものです。このモデルには、肝臓や腎臓などの臓器名、腫瘍や病変などの病変関連コンセプトといった、明示的な解剖学的用語や病理学的用語でプロンプトを入力できます。プロンプトを与えると、モデルは医療画像内の対応する領域を直接セグメントします。
MedSAM-3は、テキストと画像の両方を推論できるマルチモーダル大規模言語モデル(MLLMsまたはマルチモーダルLLM)も統合しています。これらのモデルはエージェント・イン・ザ・ループ構成で動作し、より難しい症例での精度を高めるために結果を反復的に改良します。

図3. 医療画像におけるテキストプロンプトによる腫瘍セグメンテーションのためのMedSAM-3パイプライン(出典)
MedSAM-3は、X線、MRI、CT、超音波、動画データ全体で優れた性能を発揮し、実際の臨床現場においてPCSがより柔軟で効率的な医療画像ワークフローを実現できることを示しています。
ロボット手術と自動化のための適応型セグメンテーション#
ロボット手術では、ビジョンシステムを使って器具を追跡し、急速に変化する手術シーンを理解します。器具は高速に動き、照明は変化し、新しい器具がいつでも現れる可能性があるため、あらかじめ定義されたラベルシステムの維持は困難です。
PCSを使うと、ロボットは器具を追跡し、カメラを誘導し、手術手順をリアルタイムで追従できます。これにより手動でのラベリングが減り、システムを異なる手技に適応させやすくなります。外科医や自動システムは、「グリッパー」、「メス」、「カメラツール」などのテキストプロンプトを使って、画像内で何をセグメントすべきかを示せます。

図4. ロボット手術で使用される手術器具のセグメンテーション(出典)
Ultralytics YOLOE-26によるオープンボキャブラリーセグメンテーション#
プロンプト可能なコンセプトセグメンテーションに関連する、もう1つの注目すべき最先端モデルが、私たちのUltralytics YOLOE-26です。このモデルは、オープンボキャブラリーかつプロンプト駆動型のセグメンテーションをUltralytics YOLOモデルファミリーにもたらします。
YOLOE-26はUltralytics YOLO26アーキテクチャを基盤としており、オープンボキャブラリーのインスタンスセグメンテーションをサポートします。YOLOE-26では、ユーザーが複数の方法でセグメンテーションを誘導できます。
短く視覚的に接地されたフレーズで対象物を指定できるテキストプロンプトに加え、画像の手がかりに基づいて追加の指示を与える視覚的なプロンプトもサポートしています。さらに、YOLOE-26にはゼロショット推論用のプロンプト不要モードがあり、ユーザーのプロンプトなしで、内蔵されたボキャブラリーから物体を検出してセグメントできます。
YOLOE-26は、動画分析、ロボティクスの認識、エッジベースシステムなど、物体カテゴリが変化する一方で低レイテンシと安定したスループットが不可欠なアプリケーションに適しています。また、アノテーションプロセスの一部を自動化してワークフローを効率化できるため、データラベリングやデータセットのキュレーションにも特に役立ちます。
プロンプト可能なコンセプトセグメンテーションのメリットとデメリット#
プロンプト可能なコンセプトセグメンテーションを使用する主なメリットをいくつか紹介します。
- 迅速な反復とプロトタイピング: データセットを再構築したりモデルを再トレーニングしたりする代わりにプロンプトを変更することで、新しいセグメンテーションタスクをすばやくテストでき、実験と開発を加速できます。
- 分野をまたいだ適応性: 同じPCSモデルを、ワークフローをほとんど変更せずに、医療画像、ロボティクス、動画分析などの異なる分野へ適用できる場合があります。
- インタラクティブな改良: ユーザーはプロンプトを反復的に調整したり指示を追加したりして結果を改善できるため、再トレーニングなしで曖昧なシーンやエッジケースに対応しやすくなります。
PCSには明確なメリットがある一方で、考慮すべき制限もあります。
- プロンプト感度: プロンプトの記述方法や入力方法のわずかな違いが、出力に影響する可能性があります。曖昧すぎる、または具体的すぎるプロンプトは、不完全または誤ったセグメンテーションにつながることがあります。
- 予測しにくい動作: モデルは固定されたラベルから選択するのではなくプロンプトを解釈するため、シーンや入力によって結果のばらつきが大きくなる可能性があり、厳密に管理されたパイプラインでは問題になることがあります。
- 曖昧なコンセプト解釈: 主観的または明確に定義されていないコンセプトもあり、ユーザー間や画像間でセグメンテーション結果に一貫性がなくなる可能性があります。
- 非常に具体的な対象に対する信頼性の制限: プロンプトベースのモデルは一般に、微細な特徴を正確かつ一貫して識別する必要がある欠陥検出など、狭く定義されたインスタンス固有のタスクでは信頼性が低くなります。
プロンプト可能なセグメンテーションと従来のセグメンテーションの選択#
プロンプト可能なセグメンテーションを検討すると、どのアプリケーションに最適で、解決したい問題にはUltralytics YOLO26のような従来のコンピュータービジョンモデルのほうが適しているのはどのような場合か、疑問に思うかもしれません。プロンプト可能なセグメンテーションは一般的な物体には適していますが、非常に正確で一貫した結果が必要なユースケースには適していません。
欠陥検出はその好例です。製造業では、欠陥は小さく微細なことが多く、たとえば小さな傷、へこみ、位置ずれ、表面の不規則性などがあります。また、材料、照明、生産条件によって大きく異なる場合もあります。
こうした問題は単純なプロンプトで説明することが難しく、汎用モデルが確実に検出するのはさらに困難です。全体として、プロンプトベースのモデルは欠陥を見逃したり不安定な結果を生成したりしやすい一方、欠陥データを対象に特化してトレーニングされたモデルは、現実世界の検査システムにおいてはるかに信頼性が高くなります。
主なポイント#
プロンプト可能なコンセプトセグメンテーションは、新しい物体や概念が常に現れる現実世界に、ビジョンシステムを適応させやすくします。固定されたラベルに縛られる代わりに、ユーザーはセグメントしたい対象を説明するだけで、残りをモデルに任せることができ、時間を節約して手作業を減らせます。PCSには依然として制限がありますが、すでに実際のセグメンテーションの利用方法を変えつつあり、将来のビジョンシステムの中核部分になる可能性があります。
AIについてさらに詳しく知るには、GitHubリポジトリをご覧いただき、コミュニティにご参加ください。ソリューションページで、ロボティクスにおけるAIと製造業におけるコンピュータービジョンについてご覧ください。ライセンスオプションを確認して、今すぐVision AIを始めましょう。









