Meta AIのSegment Anything Model 2(SAM 2)の用途
Meta AIのSegment Anything Model 2(SAM 2)を詳しく取り上げ、さまざまな業界でどのようなリアルタイムアプリケーションに使用できるかを解説します。

2024年7月29日、Meta AIはセグメント・エニシング・モデルの第2世代であるSAM 2をリリースしました。この新しいモデルは、画像と動画の両方で、対象物に属するピクセルを特定できます。特に優れているのは、モデルがリアルタイムで動画のすべてのフレームにわたって対象物を追跡できる点です。SAM 2は、動画編集、複合現実体験、さらにコンピュータービジョンシステムのトレーニング用ビジュアルデータのアノテーション高速化に、新たな可能性をもたらします。
海洋科学、衛星画像、医療などの分野で利用されてきた従来のSAMの成功を基盤に、SAM 2は高速で移動する物体や外観の変化といった課題に対応します。精度と効率が向上したことで、幅広い用途に対応できる汎用性の高いツールになっています。この記事では、SAM 2を適用できる分野と、それがAIコミュニティーにとって重要な理由に焦点を当てます。
SAM 2とは何ですか?#
セグメント・エニシング・モデル2は、画像と動画の両方でプロンプト可能なビジュアルセグメンテーション、またはPVSをサポートする高度な基盤モデルです。PVSは、ユーザーが指定した特定のプロンプトや入力に基づいて、モデルが画像または動画のさまざまな部分をセグメンテーションしたり識別したりする技術です。プロンプトには、関心領域を示すクリック、ボックス、マスクなどを使用できます。モデルはその後、指定された領域の輪郭を示すセグメンテーションマスクを生成します。
SAM 2のアーキテクチャは、画像セグメンテーションから動画セグメンテーションにも対応するよう拡張され、従来のSAMを基盤としています。画像データとプロンプトを使用してセグメンテーションマスクを作成する、軽量なマスクデコーダーを備えています。動画では、SAM 2が過去のフレームの情報を記憶できるメモリーシステムを導入し、時間の経過に伴う正確な追跡を実現します。メモリーシステムには、セグメンテーション対象の物体に関する詳細を保存し、呼び出すコンポーネントが含まれています。SAM 2はオクルージョンにも対応し、複数のフレームにわたって物体を追跡できます。また、複数の候補マスクを生成することで、曖昧なプロンプトにも対処できます。SAM 2の高度なアーキテクチャにより、静的および動的なビジュアル環境の両方で高い能力を発揮します。
具体的には、動画セグメンテーションにおいて、SAM 2は従来手法と比べてユーザー操作が3分の1で済む一方、より高い精度を実現します。画像セグメンテーションでは、従来のセグメント・エニシング・モデル(SAM)を上回り、6倍高速かつ高精度です。この改善はSAM 2の研究論文で、37種類のデータセットを対象に示されました。そのうち23種類は、以前にSAMでテストされたデータセットです。

図1。SAMとSAM 2の比較。
興味深いことに、Meta AIのSAM 2は、これまでで最大規模の動画セグメンテーションデータセットであるSA-Vデータセットを作成することで開発されました。この大規模なデータセットには、5万本を超える動画と3,550万個のセグメンテーションマスクが含まれており、ユーザーによるインタラクティブな貢献を通じて収集されました。アノテーターはプロンプトと修正を提供し、モデルが多様なシナリオや物体の種類から学習できるようにしました。
セグメント・エニシング・モデル2の応用#
画像および動画セグメンテーションにおける高度な機能により、SAM 2はさまざまな業界で利用できます。ここでは、その応用例をいくつか紹介します。
SAM 2は拡張現実(AR)と仮想現実(VR)を実現します#
Meta AIの新しいセグメンテーションモデルは、拡張現実(AR)および仮想現実(VR)のアプリケーションに利用できます。たとえば、SAM 2は現実世界の物体を正確に識別・セグメンテーションし、仮想物体とのインタラクションをより現実的に感じられるようにします。ゲーム、教育、トレーニングなど、仮想要素と現実要素のリアルなインタラクションが不可欠なさまざまな分野で役立ちます。
ARグラスなどのデバイスがより高度になるにつれ、SAM 2の機能が近いうちに組み込まれる可能性があります。メガネをかけてリビングルームを見回す場面を想像してみてください。メガネが愛犬の水入れをセグメンテーションして認識すると、下の画像のように、水を補充するよう促してくれるかもしれません。また、新しいレシピで料理をしている場合、メガネがカウンター上の食材を識別し、手順ごとの説明やヒントを提供することで、料理体験を向上させ、必要なものがすべて手元にあることを確認できるようにします。

図2。SAM 2は近いうちにARグラスで利用される可能性があります。
セグメント・エニシング・モデル2によるソナー画像処理#
SAMモデルを使用した研究により、ソナー画像処理などの専門分野にも適用できることが示されています。ソナー画像処理には、低解像度、高いノイズレベル、画像内の物体の複雑な形状に起因する独自の課題があります。ソナー画像用にSAMをファインチューニングすることで、研究者は、海洋ごみ、地質構造、その他の関心対象など、さまざまな水中物体を正確にセグメンテーションできることを実証しました。正確で信頼性の高い水中画像処理は、生息環境マッピング、遺物の発見、脅威の検出などの作業において、海洋研究、水中文化遺産調査、漁業管理、監視に利用できます。

図3。ファインチューニングしたSAMによるソナー画像のセグメンテーション例。
SAM 2はSAMが抱えていた多くの課題を基盤として改善しているため、ソナー画像処理の分析をさらに向上させる可能性があります。正確なセグメンテーション機能は、科学研究や漁業など、さまざまな海洋分野の応用に役立ちます。たとえば、SAM 2は水中構造物の輪郭を効果的に描出し、海洋ごみを検出し、前方監視ソナー画像内の物体を識別できます。これにより、より正確で効率的な水中探査とモニタリングに貢献します。
SAM 2をソナー画像処理の分析に使用することで期待できるメリットは次のとおりです。
- 効率性:手動セグメンテーションに必要な時間と労力を削減し、専門家が分析や意思決定により集中できるようにします。
- 一貫性:大規模な海洋研究やモニタリングに不可欠な、一貫性があり再現可能なセグメンテーション結果を提供します。
- 汎用性:幅広いソナー画像に対応できるため、海洋科学や海洋産業における多様な用途に役立ちます。
SAM 2をソナー画像処理のプロセスに統合することで、海洋産業は水中探査と分析において、より高い効率、精度、信頼性を実現でき、最終的には海洋研究の成果向上につながります。
自律走行車両でSAM 2を使用する#
SAM 2のもう一つの応用分野は自律走行車両です。SAM 2は、歩行者、他の車両、道路標識、障害物などをリアルタイムで正確に識別できます。SAM 2が提供できる詳細度は、安全なナビゲーションや衝突回避の判断に不可欠です。ビジュアルデータを正確に処理することで、SAM 2は環境の詳細で信頼性の高いマップの作成を支援し、より適切な意思決定につなげます。

図4。セグメンテーションによる交通状況の理解。
SAM 2は、さまざまな照明条件、天候の変化、動的な環境で適切に動作できるため、自律走行車両にとって信頼性の高いモデルです。混雑した都市の道路でも霧のかかった高速道路でも、SAM 2は物体を一貫して正確に識別・セグメンテーションし、車両がさまざまな状況に適切に対応できるようにします。
ただし、留意すべき制限もあります。複雑で高速に移動する物体の場合、SAM 2は細部を見落とすことがあり、フレーム間で予測が不安定になる場合があります。また、混雑したシーンでは、外観が似た複数の物体を混同することもあります。こうした課題が、自動運転アプリケーションにおいて追加のセンサーやテクノロジーの統合が重要となる理由です。
SAM 2を活用した環境モニタリング#
コンピュータービジョンを使用した環境モニタリングは、アノテーション済みデータが不足している場合などに難しくなることがあります。しかし、それこそがSAM 2にとって興味深い応用分野となる理由でもあります。SAM 2は、衛星画像やドローン画像から、森林、水域、都市部、農地などのさまざまな環境特徴を正確にセグメンテーションして識別し、自然景観の変化を追跡・分析するために利用できます。特に、正確なセグメンテーションは、時間の経過に伴う森林破壊、都市化、土地利用の変化のモニタリングに役立ち、環境保全や計画策定に有用なデータを提供します。

SAM 2のようなモデルを使用して環境の経時変化を分析するメリットには、次のようなものがあります。
- 早期検出:環境劣化の初期兆候を特定し、さらなる被害を防ぐためのタイムリーな介入を可能にします。
- 資源管理:さまざまな環境特徴の状態に関する詳細な洞察を提供し、天然資源を効率的に管理できるよう支援します。
- 生物多様性の保全:野生生物の追跡と生物多様性のモニタリングに役立ち、保全活動や絶滅危惧種の保護に貢献します。
- 災害対応:洪水、山火事、ハリケーンなどの自然災害による影響の評価を支援し、迅速で効果的な災害対応と復旧計画を可能にします。
SAM 2を使った動画編集:実際に試してみましょう#
セグメント・エニシング2デモは、動画でモデルを試す優れた方法です。SAM 2のPVS機能を使用して、古いUltralyticsのYouTube動画内の3つの物体または人物をセグメンテーションし、ピクセル化しました。従来、このような動画から3人の人物を編集で除去するには時間と手間がかかり、フレームごとの手動マスキングが必要でした。しかし、SAM 2はこのプロセスを簡略化します。デモで数回クリックするだけで、関心対象の3つの物体の身元を数秒で保護できます。

図6。SAM 2デモを試す。
このデモでは、追跡対象として選択した物体にスポットライトを当てたり、追跡中の物体を消去したりするなど、さまざまなビジュアルエフェクトも試せます。デモを気に入り、SAM 2を使ったイノベーションを始める準備ができたら、モデルを実際に使用するための詳しい手順について、Ultralytics SAM 2モデルのドキュメントページをご覧ください。機能、インストール手順、サンプルを確認し、プロジェクトでSAM 2の可能性を最大限に活用してください。
まとめ#
Meta AIのセグメント・エニシング・モデル2(SAM 2)は、動画および画像のセグメンテーションを変革しています。物体追跡などのタスクが向上するにつれ、動画編集、複合現実、科学研究、医用画像処理における新たな可能性が見いだされています。複雑なタスクを容易にし、アノテーションを高速化することで、SAM 2はAIコミュニティーにとって重要なツールになろうとしています。SAM 2のようなモデルの探究と革新を続けることで、さまざまな分野でさらに画期的な応用や進歩が生まれることが期待されます。
GitHubリポジトリを探索し、私たちのコミュニティーに参加して、AIについてさらに詳しく学びましょう。製造やヘルスケアにおけるAIについて詳しく知るには、ソリューションページをご覧ください。🚀









