Meta AIのSegment Anything Model 2 (SAM 2) のアプリケーション
Meta AIのSegment Anything Model 2 (SAM 2) を深く掘り下げ、さまざまな業界でどのようなリアルタイムアプリケーションに使用できるかを理解しましょう。

2024年7月29日、Meta AIはSegment Anything Modelの第2バージョンであるSAM 2をリリースしました。この新しいモデルは、画像と動画の両方でターゲットオブジェクトにどのピクセルが属しているかを正確に特定できます!最も優れている点は、モデルがリアルタイムで動画のすべてのフレームにわたってオブジェクトを継続的に追跡できることです。SAM 2は、動画編集、ミックス現実体験、そしてコンピュータビジョンシステムのトレーニングに向けた視覚データのより迅速なアノテーションに向けた、エキサイティングな可能性を切り開きます。
海洋科学、衛星画像、医療などの分野で使用されてきた従来のSAMの成功を基盤として、SAM 2は高速で移動するオブジェクトや外観の変化といった課題に取り組みます。その向上した精度と効率性により、幅広いアプリケーションに対応する汎用性の高いツールとなっています。この記事では、SAM 2が適用できる領域と、それがAIコミュニティにとって重要な理由に焦点を当てます。
SAM 2とは?#
Segment Anything Model 2は、画像と動画の両方においてプロンプト可能な視覚的セグメンテーション(PVS)をサポートする高度な基盤モデルです。PVSは、ユーザーによって与えられた特定のプロンプトや入力に基づいて、モデルが画像や動画のさまざまな部分をセグメント化または識別できる技術です。これらのプロンプトは、関心領域をハイライトするクリック、ボックス、またはマスクの形式にすることができます。その後、モデルは指定された領域の輪郭を描くセグメンテーションマスクを生成します。
SAM 2のアーキテクチャは、オリジナルのSAMを基盤としており、画像セグメンテーションから動画セグメンテーションへと拡張されています。画像データとプロンプトを使用してセグメンテーションマスクを作成する軽量なマスクデコーダーを備えています。動画に関しては、SAM 2は前フレームからの情報を記憶するメモリーシステムを導入しており、時間の経過とともに正確な追跡を可能にしています。このメモリーシステムには、セグメント化されるオブジェクトに関する詳細を保存し、呼び出すコンポーネントが含まれています。また、SAM 2はオクルージョン(遮蔽)への対応や、複数フレームにわたるオブジェクトの追跡、さらに複数のマスク候補を生成することによる曖昧なプロンプトの管理も可能です。SAM 2の高度なアーキテクチャにより、静的および動的な視覚環境の両方で高い能力を発揮します。
具体的に動画セグメンテーションに関して、SAM 2は従来の手法と比較して3分の1のユーザーインタラクションでより高い精度を達成しています。画像セグメンテーションにおいて、SAM 2は元のSegment Anything Model (SAM)を上回り、6倍高速かつ高精度です。この改良は、SAMが以前にテストされた23のデータセットを含む37の異なるデータセットにわたるSAM 2の研究論文で実証されました。

図 1 SAMとSAM 2の比較。
興味深いことに、Meta AIのSAM 2は、これまでにない最大の動画セグメンテーションデータセットであるSA-Vデータセットを作成することによって開発されました。この大規模なデータセットには、50,000本を超える動画と3,550万個のセグメンテーションマスクが含まれており、インタラクティブなユーザーの貢献を通じて収集されました。アノテーターは、モデルが多種多様なシナリオやオブジェクトタイプから学習できるように、プロンプトと修正を提供しました。
Segment Anything Model 2の用途#
画像および動画セグメンテーションにおける高度な能力により、SAM 2はさまざまな業界で活用できます。いくつかの用途を見ていきましょう。
SAM 2が実現する拡張現実(AR)と仮想現実(VR)#
Meta AIの新しいセグメンテーションモデルは、拡張現実(AR)および仮想現実(VR)のアプリケーションに使用できます。たとえば、SAM 2は現実世界のオブジェクトを正確に識別してセグメント化し、仮想オブジェクトとのインタラクションをよりリアルに感じさせることができます。仮想要素と現実要素の間のリアルなインタラクションが不可欠である、ゲーム、教育、トレーニングなどのさまざまな分野で役立ちます。
ARグラスなどのデバイスの高度化に伴い、SAM 2の機能がそれらに統合される日も近いでしょう。グラスをかけてリビングルームを見渡す場面を想像してみてください。グラスがペットの犬の水飲みボウルをセグメント化して認識すれば、下の画像のように、補充のタイミングをリマインドしてくれるかもしれません。また、新しいレシピで料理をしている場合、グラスがキッチンカウンターの材料を識別し、ステップバイステップの指示やヒントを提供することで、料理体験を向上させ、必要なものが手元にあることを確認できます。

図 2 ARグラスで使用される可能性のあるSAM 2。
Segment Anything Model 2を用いたソナー画像解析#
モデルSAMを使用した研究により、ソナー画像などの特殊なドメインに適用できることが示されています。ソナー画像には、低解像度、高ノイズレベル、画像内のオブジェクトの複雑な形状に起因する独自の課題があります。ソナー画像用にSAMをファインチューニングすることにより、研究者は海洋ゴミ、地質学的地形、その他の関心のあるアイテムなど、さまざまな水中オブジェクトを正確にセグメント化する能力を実証しました。正確で信頼性の高い水中画像は、生息地のマッピング、人工物の発見、脅威の検出などのタスクのために、海洋研究、水中考古学、漁業管理、監視で使用できます。

図 3 ソナー画像のセグメンテーションにファインチューニングされたSAMを使用した例。
SAM 2はSAMが直面する多くの課題を基盤とし、それを改善しているため、ソナー画像の分析をさらに改善するポテンシャルを持っています。その正確なセグメンテーション機能は、科学研究や漁業を含むさまざまな海洋アプリケーションを支援できます。たとえば、SAM 2は水中の構造物の輪郭を効果的に描き、海洋ゴミを検出し、前方探知ソナー画像内のオブジェクトを識別することができ、より正確で効率的な水中の探索と監視に貢献します。
SAM 2を使用してソナー画像を解析することの潜在的なメリットは以下の通りです。
- 効率性: 手作業によるセグメンテーションに必要な時間と労力を削減し、専門家が解析や意思決定により集中できるようにします。
- 一貫性: 大規模な海洋調査や監視に不可欠な、一貫性があり再現可能なセグメンテーション結果を提供します。
- 汎用性: 幅広い種類のソナー画像に対応可能であり、海洋科学や産業の多様なアプリケーションに役立ちます。
SAM 2をソナー画像プロセスに統合することで、海洋業界は水中探査や解析の効率性、精度、信頼性を高め、最終的には海洋研究におけるより良い成果につなげることができます。
自動運転車におけるSAM 2の利用#
自動運転車におけるSAM 2のもう1つのアプリケーションがあります。SAM 2は、歩行者、他の車両、道路標識、障害物などのオブジェクトをリアルタイムで正確に識別できます。SAM 2が提供できる詳細レベルは、安全なナビゲーションと衝突回避の決定を下すために不可欠です。視覚データを正確に処理することにより、SAM 2は環境の詳細で信頼性の高いマップの作成を支援し、より良い意思決定につながります。

図4. セグメンテーションを用いた交通状況の把握。
さまざまな照明条件、気象変化、動的な環境で優れた性能を発揮するSAM 2の能力は、自動運転車にとって信頼できるものとなります。交通量の多い都市の道路であっても霧の深い高速道路であっても、SAM 2は一貫して正確にオブジェクトを識別およびセグメント化し、車両が状況に応じて正しく対応できるようにします。
ただし、いくつかの制限事項には注意が必要です。複雑で高速移動するオブジェクトに対しては、SAM 2は微細な詳細を見逃すことがあり、フレーム間での予測が不安定になる場合があります。また、混雑したシーンでは同様の外観を持つ複数のオブジェクトを混同することがあります。これらの課題があるため、自動運転アプリケーションにおいては、他のセンサーや技術との統合が重要です。
SAM 2による環境モニタリング#
コンピュータビジョンを使用した環境モニタリングは、特にアノテーション済みデータが不足している場合には困難な場合がありますが、それこそがSAM 2にとって興味深いアプリケーションである理由でもあります。SAM 2は、衛星画像やドローン画像から、森林、水域、都市部、農業地などのさまざまな環境的特徴を正確にセグメント化して識別することにより、自然の景観の変化を追跡および分析するために使用できます。具体的には、正確なセグメンテーションは、森林破壊、都市化、および時間の経過に伴う土地利用の変化をモニタリングするのに役立ち、環境保全と計画のための貴重なデータを提供します。

SAM 2のようなモデルを使用して環境変化を長期間にわたって解析するメリットをいくつか挙げます。
- 早期検知: 環境悪化の初期兆候を特定し、さらなる被害を防ぐためのタイムリーな介入を可能にします。
- リソース管理: さまざまな環境的特徴の状態に関する詳細な洞察を提供することで、天然資源の効率的な管理を支援します。
- 生物多様性の保全: 野生生物の追跡や生物多様性のモニタリングを支援し、保全活動や絶滅危惧種の保護に貢献します。
- 災害対応: 洪水、山火事、ハリケーンなどの自然災害の影響評価を助け、迅速かつ効果的な災害対応と復旧計画の策定を可能にします。
SAM 2による動画編集:実際に試してみよう#
Segment Anything 2デモは、動画でモデルを試すための素晴らしい方法です。SAM 2のPVS機能を使用して、古いUltralyticsのYouTube動画を取り上げ、動画内の3つのオブジェクトまたは人物をセグメント化してモザイク処理することができました。従来、このように動画から3人の個人を編集して取り除くことは、時間がかかり面倒であり、手動でのフレームごとのマスキングが必要でした。しかし、SAM 2はこのプロセスを簡素化します。デモで数回クリックするだけで、数秒のうちに関心のある3つのオブジェクトの身元を保護できます。

図6. SAM 2デモを試す。
このデモでは、追跡対象として選択したオブジェクトにスポットライトを当てることや、追跡中のオブジェクトを消去するなど、いくつかの異なる視覚効果を試すこともできます。デモが気に入り、SAM 2でイノベーションを開始する準備ができたら、モデルの実践的な詳細手順についてUltralytics SAM 2モデルのドキュメントページを確認してください。機能、インストールの手順、例を探索して、プロジェクトでSAM 2のポテンシャルを最大限に活用してください!
まとめ#
Meta AIのSegment Anything Model 2 (SAM 2) は、動画および画像セグメンテーションを変革しています。オブジェクト追跡のようなタスクが改善されるにつれ、私たちは動画編集、複合現実、科学研究、医療画像処理における新たな機会を発見しています。複雑なタスクを容易にし、アノテーションを高速化することで、SAM 2はAIコミュニティにとって重要なツールになる準備が整っています。SAM 2のようなモデルを用いた探求とイノベーションを続ける中で、私たちはさまざまな分野でさらに多くの画期的なアプリケーションや進歩が生まれることを期待できます!
GitHubリポジトリを探索し、コミュニティに参加することで、AIについてさらに詳しく知りましょう。製造業およびヘルスケアにおけるAIに関する詳細なインサイトについては、ソリューションページをご確認ください。🚀






