SAM 3を探る:Meta AIの新しいSegment Anything Model
Meta AIの新しいSegment Anything ModelであるSAM 3により、実世界の画像や動画全体で物体の検出、セグメンテーション、追跡を簡単に行う方法をご紹介します。

2025年11月19日、Meta AIはSegment Anything Model 3をリリースしました。これはSAM 3としても知られています。このSegment Anything Modelの最新バージョンでは、テキストプロンプト、ビジュアルプロンプト、画像例を使用して、現実世界の画像や動画内の物体を検出、セグメント化、追跡する新しい方法が導入されています。
SAM 3モデルはSAMとSAM 2を基盤としており、コンセプトセグメンテーション、オープンボキャブラリー検出、リアルタイム動画追跡などの新しい進歩と機能をもたらします。短い名詞句を理解し、フレーム間で物体を追跡し、従来のモデルでは一貫して扱うことが難しかった細粒度または希少なコンセプトを識別できます。
SAM 3のリリースに伴い、MetaはSAM 3Dも発表しました。この次世代モデル群は、単一の画像から物体、シーン、人体全体を再構成し、Segment Anythingのエコシステムを3D理解へと拡張します。これらの追加機能により、コンピュータビジョン、ロボティクス、メディア編集、クリエイティブワークフローにおける新しいアプリケーションが実現します。
この記事では、SAM 3とは何か、SAM 2との違い、モデルの仕組み、実世界での用途について説明します。さっそく始めましょう。
SAM 3とは?MetaのSegment Anything Model 3を解説#
SAM 3は、簡単な指示に基づいて画像や動画内の物体を識別、分離、追跡できる最先端のコンピュータビジョンモデルです。固定されたラベル一覧に依存するのではなく、自然言語と視覚的な手がかりを理解するため、見つけたい対象をモデルに簡単に伝えられます。
たとえばSAM 3では、「黄色いスクールバス」や「縞模様の猫」のような短いフレーズを入力したり、物体をクリックしたり、画像内の例をハイライトしたりできます。するとモデルは、一致するすべての物体を検出し、セグメンテーションマスク(物体に属するピクセルを正確に示す視覚的な輪郭)を生成します。SAM 3は動画フレーム間で物体を追跡し、移動中も一貫性を維持できます。
SAM 3Dによる単一画像からの3D再構成#
Meta AIの発表でもう一つ注目されるのがSAM 3Dです。これはSegment Anythingプロジェクトを3D理解へと拡張します。SAM 3Dは単一の2D画像を入力として、物体や人体の形状、姿勢、構造を3次元で再構成できます。つまり、1つの視点しか利用できない場合でも、対象が空間をどのように占めているかを推定できます。
SAM 3Dは2つの異なるモデルとしてリリースされています。SAM 3D Objectsは日常的な物体をジオメトリとテクスチャ付きで再構成し、SAM 3D Bodyは単一画像から人体の形状と姿勢を推定します。どちらのモデルもSAM 3のセグメンテーション出力を使用し、元の写真における物体の外観と位置に整合する3D表現を生成します。

図1. SAM 3Dの使用例。(出典:Meta AIのsegment anything playgroundを使用して作成)
SAM 3:検出、セグメンテーション、追跡を統合する新機能#
SAM 3が検出、セグメンテーション、追跡を1つの統合モデルにまとめるために導入した主な更新内容は次のとおりです。
- コンセプトセグメンテーションタスク: SAMとSAM 2では、物体のセグメンテーションはクリックやボックスなどのビジュアルプロンプトに依存していました。SAM 3では、短いテキストフレーズや画像内のサンプル切り抜きに基づいて物体をセグメント化できるようになりました。これにより、1つずつクリックしなくても一致するすべてのインスタンスを識別できます。
- オープンボキャブラリーのテキストプロンプト: 従来のバージョンとは異なり、SAM 3は短い自然言語フレーズを解釈できます。固定されたラベル一覧が不要になり、より具体的なコンセプトや一般的でないコンセプトも扱えるようになります。
- 検出、セグメンテーション、追跡を1つのモデルで実行: SAM 3は検出、セグメンテーション、追跡を1つのモデルに統合し、物体の検出、セグメンテーションマスクの生成、動画フレーム間での追跡に別々のシステムを使う必要をなくします。これにより、画像と動画の両方で、より一貫性があり効率的なワークフローが実現します。SAM 2にも一部の追跡機能はありましたが、SAM 3は大幅に強化された、より信頼性の高いパフォーマンスを提供します。
- 複雑なシーンでより安定した結果: SAM 3はテキスト、画像例、ビジュアルプロンプトを組み合わせられるため、視覚的なクリックだけに依存していた従来のバージョンよりも、乱雑なシーンや繰り返しの多いシーンを安定して処理できます。

図2. SAM 3では、テキストまたは画像例を使用したコンセプトセグメンテーションが導入されています。(出典)
SAM 3とSAM 2とSAM 1の比較#
さまざまな動物がいるサファリ動画を見ていて、ゾウだけを検出してセグメント化したいとします。このタスクは、SAMの各バージョンでどのようになるでしょうか。
SAMでは、セグメンテーションマスクを生成するために、各フレームで各ゾウを手動でクリックする必要があります。追跡機能がないため、新しいフレームごとにクリックし直さなければなりません。
SAM 2では、ゾウを一度クリックしてマスクを取得すると、モデルが動画全体で同じゾウを追跡できます。ただし、複数のゾウ(特定の物体)をセグメント化したい場合は、個別にクリックする必要があります。SAM 2は単独では「ゾウ」のようなカテゴリーを理解できないためです。
SAM 3では、ワークフローが大幅に簡単になります。「ゾウ」と入力するか、1頭のゾウの周囲にバウンディングボックスを描いて例を示すと、モデルが動画内のすべてのゾウを自動的に見つけ、セグメント化し、フレーム間で一貫して追跡します。従来のバージョンで使われていたクリックプロンプトとボックスプロンプトにも対応していますが、SAMやSAM 2ではできなかったテキストプロンプトと参照画像にも応答できるようになりました。
SAM 3モデルの仕組み#
次に、SAM 3モデルの仕組みとトレーニング方法を詳しく見ていきましょう。
SAM 3のモデルアーキテクチャの概要#
SAM 3は、コンセプトプロンプトとビジュアルプロンプトを1つのシステムでサポートするために、複数のコンポーネントを統合しています。モデルの中核では、Metaの統合オープンソース画像・テキストエンコーダーであるMeta Perception Encoderを使用しています。
このエンコーダーは、画像と短い名詞句の両方を処理できます。簡単に言えば、これによりSAM 3は、従来のSegment Anything Modelよりも効果的に言語と視覚の特徴を関連付けられます。
このエンコーダーの上に、SAM 3はTransformerモデルのDETRファミリーを基盤とする検出器を搭載しています。この検出器は画像内の物体を識別し、どの物体がユーザーのプロンプトに対応するかをシステムが判断するのに役立ちます。
具体的には、動画セグメンテーションにおいてSAM 3は、SAM 2のメモリバンクとメモリエンコーダーを基盤とする追跡コンポーネントを使用します。これによりモデルはフレーム間で物体の情報を保持し、時間の経過に伴って物体を再識別して追跡できます。

図3. コンセプトを使用したセグメンテーションの仕組み(出典:scontent)
Segment Anything Model 3を支えるスケーラブルなデータエンジン#
SAM 3をトレーニングするために、Metaはインターネット上に現在存在する量をはるかに上回るアノテーションデータを必要としました。高品質なセグメンテーションマスクとテキストラベルを大規模に作成するのは難しく、画像や動画内のコンセプトの全インスタンスを完全に輪郭付けるには、時間とコストがかかります。
これを解決するため、MetaはSAM 3自体、追加のAIモデル、人間のアノテーターが協働する新しいデータエンジンを構築しました。ワークフローは、SAM 3やLlamaベースのキャプション生成モデルなど、AIシステムのパイプラインから始まります。
これらのシステムは大量の画像や動画をスキャンし、キャプションを生成し、そのキャプションをテキストラベルに変換して、初期のセグメンテーションマスク候補を作成します。その後、人間とAIのアノテーターがこれらの候補をレビューします。
マスク品質の確認やコンセプトの網羅性の検証などのタスクで、人間と同等またはそれ以上の精度を達成するようトレーニングされたAIアノテーターが、単純なケースを絞り込みます。人間が介入するのは、モデルがまだ苦戦する可能性のある、より難しい例だけです。

図4. SAM 3のデータエンジン(出典)
このアプローチにより、Metaのアノテーション速度は大幅に向上します。AIアノテーターに簡単なケースを処理させることで、パイプラインは細粒度ドメインにおいて、ネガティブプロンプトでは約5倍、ポジティブプロンプトでは36%高速化されます。
この効率化により、データセットを400万を超える固有のコンセプトへとスケールさせることが可能になりました。AIによる提案、人間による修正、更新されたモデル予測という継続的なループによって、時間の経過とともにラベル品質も向上し、SAM 3はより幅広い視覚的・テキストベースのコンセプトを学習できます。
SAM 3のパフォーマンス向上#
パフォーマンスの面では、SAM 3は従来のモデルを明確に上回ります。オープンボキャブラリーのコンセプト検出とセグメンテーションを評価するMetaの新しいSA-Coベンチマークで、SAM 3は画像と動画の両方において、従来のシステムのおよそ2倍のパフォーマンスを達成しています。
また、point-to-maskやmask-to-maskletなどのインタラクティブな視覚タスクでは、SAM 2と同等以上の性能を実現します。Metaによると、ゼロショットLVIS(モデルがトレーニング例なしで希少なカテゴリーを認識する必要がある評価)や物体カウント(物体の全インスタンスが検出されたかを測定する評価)など、より難しい評価でも追加の向上が見られ、ドメインをまたいだ汎化性能の強化が示されています。
これらの精度向上に加えて、SAM 3は効率にも優れています。H200 GPU上で100個を超える物体が検出された画像を約30ミリ秒で処理し、動画内で複数の物体を追跡する際にも、ほぼリアルタイムの速度を維持します。
Segment Anything Model 3のアプリケーション#
SAM 3について理解が深まったところで、高度なテキスト誘導推論から科学研究、Meta独自の製品まで、実際のアプリケーションでどのように使われているかを見ていきましょう。
SAM 3 Agentによる複雑なテキストクエリへの対応#
SAM 3は、MetaがSAM 3 Agentと呼ぶ、より大規模なマルチモーダル言語モデル内のツールとしても使用できます。エージェントはSAM 3に「ゾウ」のような短いフレーズを与える代わりに、より複雑な質問をSAM 3が理解できる小さなプロンプトに分解できます。
たとえばユーザーが「画像内で馬の制御や誘導に使われている物体は何ですか?」と尋ねると、エージェントはさまざまな名詞句を試し、それらをSAM 3に送り、どのマスクが適切かを確認します。正しい物体が見つかるまで改善を繰り返します。
特別な推論データセットでトレーニングされていないにもかかわらず、SAM 3 AgentはReasonSegやOmniLabelなど、複雑なテキストクエリ向けに設計されたベンチマークで良好な性能を発揮します。これは、SAM 3が言語理解と細粒度のビジュアルセグメンテーションの両方を必要とするシステムをサポートできることを示しています。
SAM 3の科学・保全分野でのアプリケーション#
興味深いことに、SAM 3は詳細なビジュアルラベルが重要となる研究環境ですでに使用されています。MetaはConservation X LabsおよびOsa Conservationと協力し、1万本を超えるカメラトラップ動画を含む野生生物モニタリング用の公開データセットSA-FARIを構築しました。
すべてのフレーム内のすべての動物にボックスとセグメンテーションマスクでラベルが付けられていますが、これは手作業でアノテーションすると非常に時間がかかります。同様に海洋研究では、SAM 3がFathomNetやMBARIと併用され、水中画像のインスタンスセグメンテーションマスクを作成し、新しい評価ベンチマークを支援しています。
このようなデータセットにより、科学者は動画映像をより効率的に分析し、通常は大規模に追跡することが難しい動物や生息環境を研究できます。研究者はこれらのリソースを利用して、種の識別、行動分析、自動生態モニタリング向けの独自モデルを構築することもできます。
Metaが製品全体にSAM 3を展開する方法#
研究用途に加えて、SAM 3はMetaのコンシューマー向け製品全体で新しい機能やユースケースを支えています。すでに統合されている方法の一部を紹介します。
- Instagramの編集: クリエイターは、手作業でフレームごとに編集することなく、動画内の特定の人物や物体にエフェクトを適用できます。
- Meta AIアプリとウェブ版meta.ai: SAM 3は、画像や動画を変更、強化、リミックスするための新しいツールをサポートします。
- Facebook Marketplaceの「View in Room」: SAM 3はSAM 3Dと連携し、1枚の写真を使って家具や装飾品を自宅に配置した状態をプレビューできます。
- Aria Gen 2 research glasses: Segment Anything Model 3は、一人称視点から手や物体をセグメント化して追跡するのに役立ち、AR(拡張現実)、ロボティクス、コンテキストAIの研究を支援します。
主なポイント#
SAM 3はセグメンテーションにおける大きな前進です。コンセプトセグメンテーション、オープンボキャブラリーのテキストプロンプト、強化された追跡機能を導入しています。画像と動画の両方でパフォーマンスが大幅に向上し、SAM 3Dも加わったことで、このモデルスイートはビジョンAI、クリエイティブツール、科学研究、実世界の製品に新たな可能性をもたらします。
コミュニティに参加し、GitHubリポジトリを探索して、AIについてさらに詳しく学びましょう。独自のビジョンAIプロジェクトの構築を検討している場合は、ライセンスオプションをご確認ください。ヘルスケアにおけるAIや小売業におけるVision AIなどのアプリケーションについては、ソリューションページをご覧ください。









