YOLO Vision 2026:
ビジョンAI

Meta FAIRからのAI研究アップデート:SAM 2.1およびCoTracker3

Meta FAIRの最新AIモデル、SAM 2.1およびCoTracker3を探索し、多様な実世界のアプリケーションに向けた高度なセグメンテーションおよびトラッキング機能を提供します。

ABAbirami Vina5 min read
Meta FAIR AI研究:SAM 2.1およびCoTracker3

人工知能(AI)は、新しいイノベーションやブレイクスルーがこれまで以上に急速に登場し、活気と熱気に満ち溢れている研究分野です。ここ数週間、MetaのFundamental AI Research(FAIR)チームは、AIのさまざまな分野における課題に取り組むことを目的としたツールやモデルのセットを公開しました。これらのリリースには、医療ロボティクス拡張現実といった多様な分野に影響を与える可能性のあるアップデートが含まれています。

例えば、アップデートされたSAM 2.1モデルは物体セグメンテーションを改善し、画像や動画内の物体をより正確に特定して分離しやすくします。一方、CoTracker3はポイントトラッキングに焦点を当てており、物体が移動したり一部が隠れたりした場合でも、ビデオフレーム内のポイントを追跡し続けるのに役立ちます。

また、Metaはオンデバイス利用の効率化に向けた軽量かつ高速なLlama言語モデルの新バージョンのほか、ロボティクス向けの新しい触覚センシング技術も導入しました。この記事では、Meta FAIRによるこれらの最新リリースを取り上げ、各ツールが提供する機能を見ていきます。それでは始めましょう!

Metaの強化されたSegment Anything Model:SAM 2.1#

物体セグメンテーションは主要なコンピュータビジョンタスクであり、画像や動画内の異なる物体を特定して分離することを可能にし、関心のある特定の領域を分析しやすくします。リリース以来、MetaのSegment Anything Model 2(SAM 2)は、医用画像処理気象学など、さまざまな分野で物体セグメンテーションに使用されてきました。コミュニティからのフィードバックを基に、Metaは今回、元のモデルで遭遇したいくつかの課題に対処し、全体的なパフォーマンスを向上させるように設計された改良版であるSAM 2.1を導入しました。

SAM 2.1 model performance benchmarking

図 1. SAM 2.1モデルのパフォーマンスベンチマーク。

SAM 2.1には、新しいデータオーグメンテーション手法のおかげで、視覚的に類似した小さな物体をよりよく処理するためのアップデートが含まれています。また、より長い動画シーケンスでモデルをトレーニングすることにより、オクルージョン(物体の一部が視界から隠れること)への対処方法も改善されており、一時的に遮られた場合でも、時間の経過とともに物体を「記憶」して認識し続けることができます。例えば、誰かがの後ろを歩く人を動画で撮影している場合、SAM 2.1は物体の位置動きの記憶を使用して、視界が一時的に遮られたときの隙間を埋めることで、その人物が反対側に現れたときにトラッキングすることができます。

これらのアップデートと並行して、MetaはSAM 2 Developer Suiteをリリースしました。これにより、開発者はオープンソースのトレーニングコードと完全なデモインフラストラクチャを利用して、SAM 2.1を自分のデータファインチューニングし、さまざまなアプリケーションに統合できるようになります。

CoTracker3:Metaのトラッキングモデルとその特徴およびアップデート#

もう一つの興味深いコンピュータビジョンタスクは、ポイントトラッキングです。これには、動画内の複数のフレームにわたって特定のポイントや特徴を追跡することが含まれます。自転車に乗る人の動画を考えてみてください。ポイントトラッキングを使用すると、障害物によって一時的に隠されている場合でも、ヘルメットやホイールなど、サイクリスト上のポイントをトラッキングし続けることができます。

ポイントトラッキングは、3D再構成ロボティクス、動画編集などのアプリケーションに不可欠です。従来のモデルは、複雑なセットアップや大規模な合成データセットに依存することが多く、現実世界のシナリオに適用する際の有効性が制限されていました。

MetaのCoTracker3 トラッキングモデルは、モデルのアーキテクチャを簡素化することで、これらの制限に対処しています。また、モデルが実際の注釈なし動画から学習できるようにする疑似ラベリング手法を導入し、CoTracker3の実用的な利用における効率性とスケーラビリティを高めています。

Comparing CoTracker3 to other tracking models

図 2. CoTracker3と他のトラッキングモデルの比較。

CoTracker3を際立たせる機能の1つは、オクルージョンをうまく処理できることです。モデルが複数の追跡されたポイント間で情報を共有できるようにする手法であるクロストラックアテンションを使用することで、CoTracker3は、見えるポイントを参照して隠されたポイントの位置を推論できます。これにより、CoTracker3は、混雑したシーンで人を追跡するなど、動的な環境で非常に効果的になるように設計されています。

また、CoTracker3はオンラインモードとオフラインモードの両方を提供します。オンラインモードではリアルタイムのトラッキングが提供され、オフラインモードはビデオシーケンス全体にわたるより包括的なトラッキングに使用できるため、動画編集やアニメーションなどのタスクに最適です。

Meta FAIRによるその他のアップデートと研究#

SAM 2.1とCoTracker3はコンピュータビジョンにおけるMetaの最新の進歩を示していますが、自然言語処理(NLP)やロボティクスなど、AIの他の分野でもエキサイティングなアップデートがあります。Meta FAIRによるこれら他の最近の開発のいくつかを見てみましょう。

MetaのSpirit LM:言語およびマルチモーダルモデルにおけるAIのイノベーション#

MetaのSpirit LMは、テキストと音声の機能を組み合わせた新しいマルチモーダル言語モデルであり、AIとのインタラクションをより自然に感じさせます。テキストのみ、または音声のみを処理する従来のモデルとは異なり、Spirit LMは両者をシームレスに切り替えることができます。

Spirit LMは、より人間らしい方法で言語を理解し生成することができます。例えば、音声またはテキスト言語の両方で聞き取りと応答の両方ができるバーチャルアシスタントを強化したり、音声とテキストの間で変換を行うアクセシビリティツールをサポートしたりすることができます。

An example of text-to-speech using Meta Spirit LM

図 3. Meta Spirit LMを使用したテキスト読み上げの例。

さらに、Metaは大規模言語モデルをより効率的にするための技術を開発しました。そのうちの1つであるレイヤースキップは、特定のタスクに必要なレイヤーのみをアクティブにすることで、計算ニーズエネルギーコストを削減するのに役立ちます。これは、メモリと電力に制限のあるデバイス上のアプリケーションに特に役立ちます。

Taking the need to deploy AI applications on such devices a step further, Meta has also rolled out quantized versions of its Llama models. These models are compressed to run faster on mobile devices without sacrificing accuracy.

Meta Linguaによる最適化の未来を展望する#

AIモデルの規模と複雑さが大きくなるにつれて、そのトレーニングプロセスの最適化が極めて重要になっています。最適化に関して、Metaは大規模言語モデルのトレーニングを容易にする柔軟で効率的なコードベースであるMeta Linguaを導入しました。Meta Linguaのモジュール式設計により、研究者は実験を迅速にカスタマイズおよびスケーリングできます。

研究者は、技術的なセットアップに費やす時間を減らし、実際の研究に多くの時間を費やすことができます。また、コードベースは軽量で統合しやすいため、小規模な実験と大規模なプロジェクトの両方に適しています。これらの技術的なハードルを取り除くことにより、Meta Linguaは研究者がより迅速に進捗を生み出し、より簡単に新しいアイデアをテストできるように支援します。

An overview of Meta Lingua

図 4. Meta Linguaの概要。

AIセキュリティにおけるMetaの強化#

量子コンピューティング技術が進化するにつれて、データセキュリティに新たな課題がもたらされます。今日のコンピュータとは異なり、量子コンピュータは複雑な計算をはるかに高速に解くことができるようになる可能性が高いです。これは、機密情報を保護するために現在使用されている暗号化方式を破る可能性があることを意味します。そのため、この分野での研究はますます重要になっており、量子コンピューティングの未来に備えるにあたって、データを保護する新しい方法を開発することが不可欠です。

これに対処するため、Metaはポスト量子暗号セキュリティを強化することを目的としたツール「Salsa」を開発しました。Salsaは、研究者がAI主導の攻撃をテストし、潜在的な弱点を特定するのに役立ち、暗号システムの脆弱性をよりよく理解して対処できるようにします。高度な攻撃シナリオをシミュレートすることにより、Salsaは、量子時代のより強力でレジリエントなセキュリティ対策の開発を導くことができる貴重なインサイトを提供します。

MetaのAI:ロボット工学における最新のイノベーション#

ロボティクスにおけるMetaの最新の研究は、触覚、器用さ、および人間との協調を強化することにより、AIが物理世界とより自然に相互作用するのを支援することに焦点を当てています。具体的には、Meta Digit 360は、ロボットに洗練された触覚を与える高度な触覚センサーです。センサーは、ロボットがテクスチャ、圧力、さらには物体の形状などの詳細を検出するのに役立ちます。これらのインサイトから、ロボットはより精密に物体を扱うことができます。これは、医療製造などの分野で非常に重要です。

Meta Digit 360の主な機能の一部を以下に示します:

  • 18種類の独自のセンシング機能を備えており、幅広い触覚詳細をキャプチャできます。
  • センサーは1ミリニュートンというわずかな圧力変化を検出でき、ロボットが細かいテクスチャや微妙な動きに応答できるようにします。
  • 指先表面に800万個以上のタクセル(微細なセンシングポイント)が含まれており、触覚情報の高解像度マップを提供します。

Meta Digit 360の拡張版として、さまざまな触覚センサーを単一のロボットハンドに統合するプラットフォーム、Meta Digit Plexusがあります。この設定により、人間の手が感覚データを収集する方法と同様に、ロボットは複数のポイントからの触覚情報を一度に処理できるようになります。

The Meta Digit Plexus tactile sensing platform

図 5. Meta Digit Plexus。

AIの次の章に向けた舞台設定#

SAM 2.1やCoTracker3によるコンピュータビジョンの進歩から、言語モデルやロボット工学における新たな開発まで、Metaの最新のAIアップデートは、AIが理論から実用的でインパクトのあるソリューションへと着実に移行していることを示しています。

これらのツールは、AIをさまざまな分野でより適応性が高く有用なものにするように設計されており、複雑な画像のセグメンテーションから人間の言語の理解、さらには物理空間での人間との協働まで、あらゆることを支援します。

Meta FAIRはアクセシビリティと実用性を優先することで、AIが現実世界の課題に取り組み、私たちの日常生活を意味のある方法で強化できる未来へと近づけています。

AIに興味がありますか?最新のアップデートとインサイトについてはコミュニティに参加し、GitHubリポジトリをチェックしてください。また、自動運転車農業などの業界でコンピュータビジョンがどのように使用されているかについてもご覧いただけます!

Explore solutions

Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら

AIの未来を共に築き上げましょう!

機械学習の未来とともに旅を始めましょう