Meta FAIRのAI研究アップデート:SAM 2.1とCoTracker3
Meta FAIRの最新AIモデル、SAM 2.1とCoTracker3を詳しく見ていきます。多様な実世界のアプリケーションに向けた高度なセグメンテーションおよびトラッキング機能を提供します。

人工知能(AI)は、近年、新たな活気と熱気に包まれている研究分野です。これまでにない速さで、新たなイノベーションやブレークスルーが登場しています。ここ数週間で、Metaの基礎AI研究(FAIR)チームは、AIのさまざまな分野の課題解決を目的としたツールやモデルを発表しました。これらのリリースには、医療、ロボティクス、拡張現実など、多様な分野に影響を与える可能性のあるアップデートが含まれています。
たとえば、アップデートされたSAM 2.1モデルは物体セグメンテーションを改善し、画像や動画内の物体を正確に識別して分離しやすくします。一方、CoTracker3はポイントトラッキングに重点を置いており、物体が動いたり部分的に遮られたりしても、動画フレーム内のポイントを追跡し続けられます。
Metaは、効率的なオンデバイス利用を実現する、より軽量で高速なLlama言語モデルのバージョンや、ロボティクス向けの新しい触覚センシング技術も発表しました。この記事では、Meta FAIRによるこれらの最新リリースを詳しく解説し、それぞれのツールが提供する機能を見ていきます。さっそく始めましょう。
Metaの強化版Segment Anything Model:SAM 2.1#
物体セグメンテーションは、主要なコンピュータービジョンタスクの一つであり、画像や動画内の個別の物体を識別して分離できるため、関心のある特定領域を分析しやすくします。MetaのSegment Anything Model 2(SAM 2)はリリース以来、医用画像や気象学など、さまざまな分野で物体セグメンテーションに利用されています。コミュニティからのフィードバックを基に、Metaは今回、従来モデルで生じていた課題の一部に対応し、全体的な性能を高めるよう設計された改良版、SAM 2.1を発表しました。

図1. SAM 2.1モデルの性能ベンチマーク
SAM 2.1には、視覚的に類似した物体や小さな物体をより適切に扱うためのアップデートが含まれており、新しいデータ拡張手法によって実現されています。また、より長い動画シーケンスでトレーニングすることで、遮蔽(物体の一部が視界から隠れる状態)への対応も改善されています。これにより、物体が一時的に遮られていても、時間の経過に沿って物体を「記憶」し、認識できます。たとえば、誰かが動画を撮影していて、人が木の後ろを歩いている場合、SAM 2.1は、物体の位置と動きの記憶を使って、視界が一時的に遮られた際の空白を補いながら、反対側に再び現れた人を追跡できます。
これらのアップデートと併せて、MetaはSAM 2 Developer Suiteもリリースしました。これにはオープンソースのトレーニングコードと完全なデモインフラストラクチャが含まれており、開発者は独自のデータでSAM 2.1をファインチューニングし、さまざまなアプリケーションに統合できます。
CoTracker3:Metaのトラッキングモデル、その機能とアップデート#
もう一つの興味深いコンピュータービジョンタスクが、ポイントトラッキングです。これは、動画内の複数のフレームにわたって特定のポイントや特徴を追跡する処理です。サイクリストがトラックを走行する動画を考えてみましょう。ポイントトラッキングを使うと、障害物に一時的に隠れても、モデルはヘルメットや車輪など、サイクリスト上のポイントを追跡できます。
ポイントトラッキングは、3D再構成、ロボティクス、動画編集などのアプリケーションに不可欠です。従来のモデルは、複雑な構成や大規模な合成データセットに依存することが多く、実世界のシナリオに適用した場合の有効性が制限されていました。
MetaのCoTracker3 トラッキングモデルは、モデルアーキテクチャを簡素化することで、これらの制限に対処します。また、実際のアノテーションなし動画からモデルが学習できる、擬似ラベリング手法も導入しています。これにより、CoTracker3は実用においてより効率的でスケーラブルになっています。

図2. CoTracker3と他のトラッキングモデルの比較
CoTracker3を際立たせる機能の一つは、遮蔽に適切に対応できることです。複数の追跡ポイント間でモデルが情報を共有できる手法であるクロストラックアテンションを使用することで、CoTracker3は見えているポイントを参照し、隠れたポイントの位置を推測できます。このように、CoTracker3は、混雑したシーンで人物を追跡する場合など、動的な環境で非常に効果を発揮するよう設計されています。
CoTracker3は、オンラインモードとオフラインモードの両方を提供します。オンラインモードはリアルタイムトラッキングを実現し、オフラインモードは動画シーケンス全体にわたる、より包括的なトラッキングに利用できます。動画編集やアニメーションなどのタスクに適しています。
Metaによるその他のアップデートと研究#
SAM 2.1とCoTracker3は、Metaの最新のコンピュータービジョンの進歩を示すものですが、自然言語処理(NLP)やロボティクスなど、AIの他の分野でも注目すべきアップデートがあります。Meta FAIRによるその他の最近の開発をいくつか見てみましょう。
MetaのSpirit LM:言語モデルとマルチモーダルモデルにおけるAIイノベーション#
MetaのSpirit LMは、テキストと音声の機能を組み合わせた新しいマルチモーダル言語モデルで、AIとのインタラクションをより自然にします。テキストのみ、または音声のみを扱う従来のモデルとは異なり、Spirit LMは両者をシームレスに切り替えられます。
Spirit LMは、より人間らしい方法で言語を理解して生成できます。たとえば、音声または文章で聞き取りと応答の両方ができるバーチャルアシスタントを強化したり、音声とテキストを相互変換するアクセシビリティツールをサポートしたりできます。

図3. Meta Spirit LMを使用した音声合成の例
さらに、Metaは大規模言語モデルをより効率的にする手法を開発しました。その一つであるLayer Skipは、特定のタスクに必要なレイヤーだけを有効化することで、計算要件とエネルギーコストの削減に役立ちます。これは、メモリや電力が限られたデバイス上のアプリケーションに特に有用です。
このようなデバイスにAIアプリケーションをデプロイする必要性をさらに踏まえ、MetaはLlamaモデルの量子化バージョンも展開しました。これらのモデルは、精度を犠牲にすることなく、モバイルデバイス上でより高速に動作するよう圧縮されています。
Meta Linguaによる最適化の未来#
AIモデルの規模と複雑さが増すにつれ、そのトレーニングプロセスの最適化が重要になっています。最適化に関して、MetaはMeta Linguaを発表しました。これは柔軟で効率的なコードベースであり、大規模言語モデルのトレーニングを容易にします。Meta Linguaのモジュール設計により、研究者は実験を迅速にカスタマイズしてスケールできます。
研究者は技術的なセットアップに費やす時間を減らし、実際の研究により多くの時間を使えるようになります。コードベースは軽量で統合も容易なため、小規模な実験から大規模プロジェクトまで適しています。こうした技術的な障壁を取り除くことで、Meta Linguaは研究者がより迅速に進歩し、新しいアイデアをより容易に検証できるよう支援します。

図4. Meta Linguaの概要
MetaによるAIセキュリティの強化#
量子コンピューティング技術の進歩は、データセキュリティに新たな課題をもたらしています。現在のコンピューターとは異なり、量子コンピューターは複雑な計算をはるかに高速に解けるようになる可能性があります。つまり、機密情報を保護するために現在使用されている暗号化方式を、破る可能性があります。そのため、この分野の研究はますます重要になっています。量子コンピューティングの未来に備えるには、データを保護する新たな方法の開発が不可欠です。
これに対応するため、Metaはポスト量子暗号セキュリティの強化を目的としたツール、Salsaを開発しました。Salsaは研究者がAIを利用した攻撃をテストし、潜在的な弱点を特定するのに役立ち、暗号システムの脆弱性をより深く理解して対処できるようにします。高度な攻撃シナリオをシミュレーションすることで、Salsaは量子時代に向けた、より強固でレジリエントなセキュリティ対策の開発に役立つ貴重な知見を提供します。
MetaにおけるAI:ロボティクスの最新イノベーション#
Metaの最新のロボティクス研究は、触覚知覚、器用さ、人間との協働を向上させることで、AIが物理世界とより自然に関われるようにすることに重点を置いています。特にMeta Digit 360は、ロボットに高度な触覚を与える先進的な触覚センサーです。このセンサーにより、ロボットは質感、圧力、さらには物体の形状といった細部を検知できます。こうした情報を基に、ロボットは物体をより正確に扱えるようになります。これは、医療や製造などの分野で重要です。
Meta Digit 360に搭載されている主な機能は次のとおりです。
- 幅広い触覚の詳細を捉えられるよう、18種類の個別のセンシング機能を備えています。
- センサーは1ミリニュートンという小さな圧力変化を検知できるため、ロボットは微細な質感やわずかな動きに反応できます。
- 指先の表面全体に800万個を超えるタクセル(小さなセンシングポイント)を備え、触覚情報を高解像度でマッピングできます。
Meta Digit 360を拡張したMeta Digit Plexusは、さまざまなタッチセンサーを一つのロボットハンドに統合するプラットフォームです。この構成により、人間の手が感覚情報を収集する仕組みと同様に、ロボットは複数のポイントからの触覚情報を同時に処理できます。

図5. Meta Digit Plexus
AIの次の章に向けた基盤づくり#
SAM 2.1とCoTracker3によるコンピュータービジョンの進歩から、言語モデルやロボティクスにおける新たな展開まで、Metaの最新AIアップデートは、AIが理論から実用的で大きな影響をもたらすソリューションへと着実に移行していることを示しています。
これらのツールは、AIをさまざまな分野でより適応性が高く有用なものにするよう設計されています。複雑な画像のセグメンテーションから人間の言語の理解、さらには物理空間で私たちと協働することまで、幅広い用途に役立ちます。
アクセシビリティと実世界での応用を重視することで、Meta FAIRは、AIが現実世界の課題に取り組み、私たちの日常生活を有意義な形で向上させられる未来に近づけています。
AIに興味がありますか?私たちのコミュニティに参加して最新のアップデートや知見を入手し、GitHubリポジトリもご覧ください。また、コンピュータービジョンが自動運転車や農業などの産業でどのように活用できるかもご確認ください。






