Meta FAIRからのAI研究アップデート:SAM 2.1およびCoTracker3
Meta FAIRの最新AIモデル、SAM 2.1およびCoTracker3を探索し、多様な実世界のアプリケーションに向けた高度なセグメンテーションおよびトラッキング機能を提供します。

人工知能(AI)は、新しいイノベーションやブレイクスルーがこれまで以上に急速に登場し、活気と熱気に満ち溢れている研究分野です。ここ数週間、MetaのFundamental AI Research(FAIR)チームは、AIのさまざまな分野における課題に取り組むことを目的としたツールやモデルのセットを公開しました。これらのリリースには、医療、ロボティクス、拡張現実といった多様な分野に影響を与える可能性のあるアップデートが含まれています。
例えば、アップデートされたSAM 2.1モデルは物体セグメンテーションを改善し、画像や動画内の物体をより正確に特定して分離しやすくします。一方、CoTracker3はポイントトラッキングに焦点を当てており、物体が移動したり一部が隠れたりした場合でも、ビデオフレーム内のポイントを追跡し続けるのに役立ちます。
また、Metaはオンデバイス利用の効率化に向けた軽量かつ高速なLlama言語モデルの新バージョンのほか、ロボティクス向けの新しい触覚センシング技術も導入しました。この記事では、Meta FAIRによるこれらの最新リリースを取り上げ、各ツールが提供する機能を見ていきます。それでは始めましょう!
Metaの強化されたSegment Anything Model:SAM 2.1#
物体セグメンテーションは主要なコンピュータビジョンタスクであり、画像や動画内の異なる物体を特定して分離することを可能にし、関心のある特定の領域を分析しやすくします。リリース以来、MetaのSegment Anything Model 2(SAM 2)は、医用画像処理や気象学など、さまざまな分野で物体セグメンテーションに使用されてきました。コミュニティからのフィードバックを基に、Metaは今回、元のモデルで遭遇したいくつかの課題に対処し、全体的なパフォーマンスを向上させるように設計された改良版であるSAM 2.1を導入しました。

図 1. SAM 2.1モデルのパフォーマンスベンチマーク。
SAM 2.1には、新しいデータオーグメンテーション手法のおかげで、視覚的に類似した小さな物体をよりよく処理するためのアップデートが含まれています。また、より長い動画シーケンスでモデルをトレーニングすることにより、オクルージョン(物体の一部が視界から隠れること)への対処方法も改善されており、一時的に遮られた場合でも、時間の経過とともに物体を「記憶」して認識し続けることができます。例えば、誰かが木の後ろを歩く人を動画で撮影している場合、SAM 2.1は物体の位置と動きの記憶を使用して、視界が一時的に遮られたときの隙間を埋めることで、その人物が反対側に現れたときにトラッキングすることができます。
これらのアップデートと並行して、MetaはSAM 2 Developer Suiteをリリースしました。これにより、開発者はオープンソースのトレーニングコードと完全なデモインフラストラクチャを利用して、SAM 2.1を自分のデータでファインチューニングし、さまざまなアプリケーションに統合できるようになります。
CoTracker3:Metaのトラッキングモデルとその特徴およびアップデート#
もう一つの興味深いコンピュータビジョンタスクは、ポイントトラッキングです。これには、動画内の複数のフレームにわたって特定のポイントや特徴を追跡することが含まれます。自転車に乗る人の動画を考えてみてください。ポイントトラッキングを使用すると、障害物によって一時的に隠されている場合でも、ヘルメットやホイールなど、サイクリスト上のポイントをトラッキングし続けることができます。
ポイントトラッキングは、3D再構成、ロボティクス、動画編集などのアプリケーションに不可欠です。従来のモデルは、複雑なセットアップや大規模な合成データセットに依存することが多く、現実世界のシナリオに適用する際の有効性が制限されていました。
MetaのCoTracker3 トラッキングモデルは、モデルのアーキテクチャを簡素化することで、これらの制限に対処しています。また、モデルが実際の注釈なし動画から学習できるようにする疑似ラベリング手法を導入し、CoTracker3の実用的な利用における効率性とスケーラビリティを高めています。

図 2. CoTracker3と他のトラッキングモデルの比較。
CoTracker3を際立たせる機能の1つは、オクルージョンをうまく処理できることです。モデルが複数の追跡されたポイント間で情報を共有できるようにする手法であるクロストラックアテンションを使用することで、CoTracker3は、見えるポイントを参照して隠されたポイントの位置を推論できます。これにより、CoTracker3は、混雑したシーンで人を追跡するなど、動的な環境で非常に効果的になるように設計されています。
また、CoTracker3はオンラインモードとオフラインモードの両方を提供します。オンラインモードではリアルタイムのトラッキングが提供され、オフラインモードはビデオシーケンス全体にわたるより包括的なトラッキングに使用できるため、動画編集やアニメーションなどのタスクに最適です。
Meta FAIRによるその他のアップデートと研究#
SAM 2.1とCoTracker3はコンピュータビジョンにおけるMetaの最新の進歩を示していますが、自然言語処理(NLP)やロボティクスなど、AIの他の分野でもエキサイティングなアップデートがあります。Meta FAIRによるこれら他の最近の開発のいくつかを見てみましょう。
MetaのSpirit LM:言語およびマルチモーダルモデルにおけるAIのイノベーション#
MetaのSpirit LMは、テキストと音声の機能を組み合わせた新しいマルチモーダル言語モデルであり、AIとのインタラクションをより自然に感じさせます。テキストのみ、または音声のみを処理する従来のモデルとは異なり、Spirit LMは両者をシームレスに切り替えることができます。
Spirit LMは、より人間らしい方法で言語を理解し生成することができます。例えば、音声またはテキスト言語の両方で聞き取りと応答の両方ができるバーチャルアシスタントを強化したり、音声とテキストの間で変換を行うアクセシビリティツールをサポートしたりすることができます。

図 3. Meta Spirit LMを使用したテキスト読み上げの例。
さらに、Metaは大規模言語モデルをより効率的にするための技術を開発しました。そのうちの1つであるレイヤースキップは、特定のタスクに必要なレイヤーのみをアクティブにすることで、計算ニーズとエネルギーコストを削減するのに役立ちます。これは、メモリと電力に制限のあるデバイス上のアプリケーションに特に役立ちます。
Taking the need to deploy AI applications on such devices a step further, Meta has also rolled out quantized versions of its Llama models. These models are compressed to run faster on mobile devices without sacrificing accuracy.
Meta Linguaによる最適化の未来を展望する#
AIモデルの規模と複雑さが大きくなるにつれて、そのトレーニングプロセスの最適化が極めて重要になっています。最適化に関して、Metaは大規模言語モデルのトレーニングを容易にする柔軟で効率的なコードベースであるMeta Linguaを導入しました。Meta Linguaのモジュール式設計により、研究者は実験を迅速にカスタマイズおよびスケーリングできます。
研究者は、技術的なセットアップに費やす時間を減らし、実際の研究に多くの時間を費やすことができます。また、コードベースは軽量で統合しやすいため、小規模な実験と大規模なプロジェクトの両方に適しています。これらの技術的なハードルを取り除くことにより、Meta Linguaは研究者がより迅速に進捗を生み出し、より簡単に新しいアイデアをテストできるように支援します。

図 4. Meta Linguaの概要。
AIセキュリティにおけるMetaの強化#
量子コンピューティング技術が進化するにつれて、データセキュリティに新たな課題がもたらされます。今日のコンピュータとは異なり、量子コンピュータは複雑な計算をはるかに高速に解くことができるようになる可能性が高いです。これは、機密情報を保護するために現在使用されている暗号化方式を破る可能性があることを意味します。そのため、この分野での研究はますます重要になっており、量子コンピューティングの未来に備えるにあたって、データを保護する新しい方法を開発することが不可欠です。
これに対処するため、Metaはポスト量子暗号セキュリティを強化することを目的としたツール「Salsa」を開発しました。Salsaは、研究者がAI主導の攻撃をテストし、潜在的な弱点を特定するのに役立ち、暗号システムの脆弱性をよりよく理解して対処できるようにします。高度な攻撃シナリオをシミュレートすることにより、Salsaは、量子時代のより強力でレジリエントなセキュリティ対策の開発を導くことができる貴重なインサイトを提供します。
MetaのAI:ロボット工学における最新のイノベーション#
ロボティクスにおけるMetaの最新の研究は、触覚、器用さ、および人間との協調を強化することにより、AIが物理世界とより自然に相互作用するのを支援することに焦点を当てています。具体的には、Meta Digit 360は、ロボットに洗練された触覚を与える高度な触覚センサーです。センサーは、ロボットがテクスチャ、圧力、さらには物体の形状などの詳細を検出するのに役立ちます。これらのインサイトから、ロボットはより精密に物体を扱うことができます。これは、医療や製造などの分野で非常に重要です。
Meta Digit 360の主な機能の一部を以下に示します:
- 18種類の独自のセンシング機能を備えており、幅広い触覚詳細をキャプチャできます。
- センサーは1ミリニュートンというわずかな圧力変化を検出でき、ロボットが細かいテクスチャや微妙な動きに応答できるようにします。
- 指先表面に800万個以上のタクセル(微細なセンシングポイント)が含まれており、触覚情報の高解像度マップを提供します。
Meta Digit 360の拡張版として、さまざまな触覚センサーを単一のロボットハンドに統合するプラットフォーム、Meta Digit Plexusがあります。この設定により、人間の手が感覚データを収集する方法と同様に、ロボットは複数のポイントからの触覚情報を一度に処理できるようになります。

図 5. Meta Digit Plexus。
AIの次の章に向けた舞台設定#
SAM 2.1やCoTracker3によるコンピュータビジョンの進歩から、言語モデルやロボット工学における新たな開発まで、Metaの最新のAIアップデートは、AIが理論から実用的でインパクトのあるソリューションへと着実に移行していることを示しています。
これらのツールは、AIをさまざまな分野でより適応性が高く有用なものにするように設計されており、複雑な画像のセグメンテーションから人間の言語の理解、さらには物理空間での人間との協働まで、あらゆることを支援します。
Meta FAIRはアクセシビリティと実用性を優先することで、AIが現実世界の課題に取り組み、私たちの日常生活を意味のある方法で強化できる未来へと近づけています。
AIに興味がありますか?最新のアップデートとインサイトについてはコミュニティに参加し、GitHubリポジトリをチェックしてください。また、自動運転車や農業などの業界でコンピュータビジョンがどのように使用されているかについてもご覧いただけます!






