YOLO Vision 2026:
ビジョンAI

Meta Movie Gen: コンテンツ制作の再構築

Meta Movie Genがビデオおよびサウンド制作をどのように再定義しているかをご覧ください。このモデルがどのように正確なビデオ編集を提供し、パーソナライズされたメディア制作をサポートするかを解説します。

ABAbirami Vina4 min read
Meta Movie GenによるAIビデオ制作

映像制作を目指す方や、視聴者向けに動画を作るのが好きなコンテンツクリエイターにとって、創造性を広げてくれるAIツールがあることは常に役立ちます。最近、Metaは、Meta Movie Genとして知られる最新の生成AI動画モデルを発表しました。

メディアおよびエンターテインメント業界におけるグローバルなgenerative AI marketは、2033年までに115億7千万ドルに達すると予測されており、Runway、OpenAIMetaなどの企業が画期的なイノベーションをリードしています。特にMeta Movie Genは、映画制作、動画コンテンツ制作、デジタルストーリーテリングなどの用途に最適であり、高品質なAI生成動画を通じて創造的なビジョンをこれまで以上に簡単に実現できるようにします。この記事では、Meta Movie Genとその仕組みについて詳しく見ていきます。また、そのいくつかの用途についても詳しく取り上げます。それでは始めましょう!

Meta Movie Genを使用して生成された動画クリップのフレーム

Fig 1。Meta Movie Genを使用して生成された動画クリップのフレーム。

Meta Movie Genとは何ですか?#

Meta Movie Genとは何かを議論する前に、それがどのようにして生まれたのかを見ていきましょう。

generative AIに関するMetaの研究開発は、Make-A-Scene seriesのモデルから始まりました。この研究は、アーティストやビジョナリーが想像力を具現化するのを助ける、multimodalな生成AI手法に焦点を当てています。アーティストは画像、音声、動画、または3D animationsを入力して、望ましい画像出力得ることができます。次の飛躍的なイノベーションとなったのは、Llama Image Foundationモデル(Emu)のようなdiffusion modelsであり、これによりはるかに高品質な画像や動画の生成が可能になり、画像編集も実現しました。

Make-A-Sceneのスケッチとテキスト入力を使用して画像を生成する様子

Fig 2。Make-A-Sceneのスケッチとテキスト入力を使用して生成画像を得た例。

Movie Genは、generative AI研究に対するMetaの最新の貢献です。これは前述のすべてのモダリティを組み合わせ、よりきめ細かな制御を可能にすることで、人々がより創造的な方法でモデルを使用できるようにします。Meta Movie Genは、テキストから動画、テキストから音声、テキストから画像など、さまざまなタイプのメディアを生成するための基盤モデルのコレクションです。これは4つのモデルで構成されており、ライセンスデータと公開されているdatasetsの組み合わせでトレーニングされています。

これらのモデルの概要を以下に示します。

  • Movie Gen Videoモデル: テキストプロンプトから高品質な動画を生成する300億パラメータのモデル。
  • Movie Gen Audioモデル: 動画コンテンツと同期するサウンドトラックを作成できる130億パラメータのモデル。
  • Personalized Movie Gen Videoモデル: テキストプロンプトと単一の画像に基づいて特定の人物の動画を生成し、その容姿を保持します。
  • Movie Gen Editモデル: 実写動画やフィクション動画に対して、詳細なテキストベースの動画編集を可能にするモデル。

Meta Movie Gen動画モデルのトレーニング#

Movie Gen Videoモデルの作成とtrainingには、いくつかの重要なプロセスが関与していました。最初のステップでは、品質、動き、関連性でフィルタリングされた主に人間の活動に関する画像や動画クリップを含む、visual dataの収集と準備が行われました。その後、dataは、各シーンで何が起きているかを説明するテキストキャプションとペアにされました。Meta’s LLaMa3-Videoモデルを使用して生成されたキャプションは、各シーンの内容に関する豊富な詳細を提供し、モデルの視覚的ストーリーテリング能力を高めました。

Movie Gen Videoモデルの事前学習データパイプラインの概要

Fig 3。Movie Gen Videoモデルの事前学習データキュレーションパイプラインの概要。

trainingプロセスは、テキストを低解像度の画像に変換することをモデルが学習することから始まりました。その後、text-to-imageとテキストから動画へのトレーニングを組み合わせ、ますます高品質な視覚資料を使用して、フル動画クリップの作成へと進みました。

Temporal Autoencoder(TAE)と呼ばれるツールが動画を圧縮し、大容量のデータを効率的に管理しました。Fine-tuningによって動画の品質がさらにシャープになり、モデル平均化と呼ばれる手法(よりスムーズで一貫した結果を得るために複数のモデル出力を組み合わせる)により、出力の一貫性が高まりました。最後に、初期状態で768pだった動画は、ピクセルデータを追加して鮮明な視覚を実現する画像解像度向上技術である空間アップサンプラー手法を使用して、シャープな1080p解像度にアップスケールされました。その結果、高品質で詳細な動画出力が得られました。

Meta Movie Genの能力を探る#

Meta Movie Genモデルは、主に4つの異なる機能をサポートしています。それぞれを詳しく見ていきましょう。

動画と音声の生成#

Meta Movie Genは高品質な動画を生成できます。これらの動画クリップは最大16秒の長さで、16 fps(フレーム毎秒)で実行され、テキストプロンプトから動き、インタラクション、cameraアングルを捉えたリアルな映像を作成します。130億パラメータの音声モデルと組み合わせることで、映像に合わせて、環境音、フォーリー効果、音楽などの同期した音声を生成できます。

この設定により、さまざまなシーンやプロンプト全体で、映像と音声の両方が一貫してリアルに保たれる、シームレスで実物そっくりの体験が保証されます。例えば、これらのモデルは、タイのバイラルなコビトカバであるMoo Dengの動画クリップを作成するために使用されました。

Meta Movie Genを使用して作成されたMoo Deng動画クリップのフレーム

Fig 4。MetaのMovie Genで作成されたMoo Dengの動画クリップのフレーム。

パーソナライズされた動画生成#

Meta Movie Genモデルのもう一つの興味深い機能は、パーソナライズされた動画生成です。ユーザーは人物の画像と、動画クリップがどのように生成されるべきかを記述したテキストプロンプトを提供することができ、その結果、参照された人物を含み、テキストプロンプトで指定された豊富な視覚的詳細を取り入れた動画が生成されます。モデルは両方の入力(画像とテキスト)を使用して、人物の独自の外観と自然なbody movementsを維持しながら、プロンプトで記述されたシーンを正確に再現します。

モデルのパーソナライズされた動画生成機能の例

Fig 5。モデルのパーソナライズされた動画生成機能の例。

正確な動画編集#

Movie Gen Editモデルを使用すると、ユーザーは動画クリップとテキストプロンプトの両方を入力として提供し、動画を創造的な方法で編集できます。このモデルは動画生成と高度な画像編集を組み合わせ、要素の追加、削除、置換などの非常に具体的な編集を実行します。また、動画クリップの背景を変更したり、全体的なスタイルを変更したりするようなグローバルな変更も実行できます。しかし、このモデルを真にユニークにしているのはその精度です。編集が必要な特定のピクセルのみをターゲットにし、残りの部分はそのままにしておくことができます。これにより、元のコンテンツが可能な限り保持されます。

Movie Gen Editモデルの動画編集機能の例

Fig 6。Movie Gen Editモデルの動画編集機能のさまざまな例。

Meta Movie Genのベンチマークツール#

generative AIモデルに加えて、Metaはgenerative AIモデルのパフォーマンスをテストするためのベンチマークツールスイートであるMovie Gen Benchも導入しました。これには、Movie Gen Video BenchとMovie Gen Audio Benchという2つの主要なツールが付属しています。どちらも動画と音声生成のさまざまな側面をテストするように設計されています。

両ツールの概要を以下に示します。

  • Movie Gen Video Bench: 人間の活動、animalsnatural sceneryphysics、および珍しい被写体や活動など、幅広いテストカテゴリをカバーする1003のプロンプトで構成されています。この評価ベンチマークが特に価値がある理由は、モーションレベルの網羅性であり、これにより動画生成モデルがペースの速いシーケンスと遅いシーケンスの両方でテストされることが保証されます。
  • Movie Gen Audio Bench: 527個のプロンプト全体で音声生成能力をテストするように設計されています。これらのプロンプトは生成された動画と組み合わされ、モデルが効果音や音楽を視覚コンテンツとどれだけうまく同期できるかを評価します。

Movie Gen Benchの評価プロンプトの内訳とワードクラウド

Fig 7. この図は、評価プロンプトの内訳を示しており、左側に概念のリスト、右側によく使用される名詞と動詞のワードクラウドが表示されています。

Meta Movie Genの実用的なアプリケーション#

Meta Movie Genモデルとは何か、そしてどのように機能するかを説明しましたので、その実用的なアプリケーションの1つを探ってみましょう。

映画制作におけるMovie Gen AIイノベーション#

MetaのMovie Genの最もエキサイティングな用途の一つは、AI駆動の動画およびaudio creationを通じてfilmmakingを変革できる方法です。Movie Genを使用すると、クリエイターは簡単なtext promptsから高品質な映像と音声を生成でき、ストーリーを伝える新しい方法が広がります。

実際、MetaはBlumhouseおよび一連の映画監督と提携し、Movie Genがcreative processをどのように最適にサポートできるかについて彼らのフィードバックを集めました。Aneesh Chaganty、Spurlock姉妹、Casey Affleckなどの映画監督が、ムード、トーン、視覚的ディレクションを捉えるツールの能力をテストしました。その結果、これらのモデルが新鮮なアイデアを刺激するのに役立つことが発見されました。

このパイロットプログラムは、Movie Genが従来の映画制作に取って代わるものではないものの、監督が視覚的および音声的な要素を迅速かつ創造的に実験するための新しい方法を提供することを示しました。映画制作者たちはまた、ツールの編集機能によって、背景音、エフェクト、視覚スタイルをより自由に試すことができる点を高く評価しました。

Meta Movie Genを使用して作成された短編映画のフレーム

Fig 8。Meta Movie Genを使用して作成された短編映画のフレーム。

重要なポイント#

Meta Movie Genは、生成AIを使用して単純なテキスト記述から高品質な動画や音声を生成するための前進です。このツールは、ユーザーがリアルでカスタムな動画を簡単に作成できるように支援します。正確な動画編集やパーソナライズされたメディア生成などの機能を備えたMeta Movie Genは、ストーリーテリング、映画制作などを超えた新たな可能性を開く柔軟なツールセットを提供します。Meta Movie Genは、詳細で有用な視覚効果の作成を容易にすることで、さまざまな分野で動画が作成および使用される方法を変革し、AI主導のコンテンツ作成の新しい基準を打ち立てています。

詳細については、GitHubリポジトリをご覧いただき、コミュニティにご参加ください。ソリューションページで、自動運転車農業におけるAIの応用をご覧ください。🚀

Explore solutions

Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら

AIの未来を共に築き上げましょう!

機械学習の未来とともに旅を始めましょう