Meta Movie Gen:コンテンツ制作を再構想
Meta Movie Genが動画と音声の制作をどのように再定義しているかをご紹介します。このモデルが高精度な動画編集を実現し、パーソナライズされたメディア制作をサポートする方法を学べます。

将来映画制作者を目指している方でも、視聴者向けの動画制作を楽しむコンテンツクリエイターでも、創造性を広げるAIツールがあると常に役立ちます。最近、Metaは、Meta Movie Genとして知られる最新の生成動画モデルを発表しました。
メディアおよびエンターテインメントにおける世界の生成AI市場は、2033年までに115億7,000万ドルに達すると予測されており、Runway、OpenAI、Metaなどの企業が画期的なイノベーションを先導しています。特にMeta Movie Genは、映画制作、動画コンテンツ制作、デジタルストーリーテリングなどの用途に適しており、高品質なAI生成動画を通じてクリエイティブなビジョンをこれまで以上に簡単に形にできます。この記事では、Meta Movie Genとその仕組みについて解説します。また、その用途の一部についても詳しく見ていきます。それでは始めましょう。

図1。Meta Movie Genを使用して生成された動画クリップのフレームです。
Meta Movie Genとは何ですか?#
Meta Movie Genとは何かを説明する前に、どのように誕生したのかを見てみましょう。
生成AIに関するMetaの研究は、モデルのMake-A-Sceneシリーズから始まりました。この研究は、アーティストや先見性のあるクリエイターが想像力を形にできるよう支援する、マルチモーダル生成AI手法に焦点を当てています。アーティストは、画像、音声、動画、または3Dアニメーションを入力して、望ましい画像出力を得ることができます。次の大きなイノベーションは、Llama Image Foundationモデル(Emu)などの拡散モデルによってもたらされました。これにより、はるかに高品質な画像や動画を生成できるようになり、画像編集も可能になりました。

図2。Make-A-Sceneのスケッチとテキスト入力を使用して画像を生成する例です。
Movie Genは、生成AI研究に対するMetaの最新の貢献です。これまでに説明したすべてのモダリティを組み合わせ、さらにきめ細かな制御を可能にすることで、ユーザーはよりクリエイティブな方法でモデルを利用できます。Meta Movie Genは、テキストから動画、テキストから音声、テキストから画像など、さまざまな種類のメディアを生成する基盤モデルの集合です。ライセンス取得済みおよび一般公開されているdatasetsを組み合わせて学習した4つのモデルで構成されています。
これらのモデルの概要を簡単に説明します。
- **Movie Gen Videoモデル:**テキストプロンプトから高品質な動画を生成する300億パラメータのモデルです。
- **Movie Gen Audioモデル:**動画コンテンツと同期するサウンドトラックを作成できる130億パラメータのモデルです。
- **Personalized Movie Gen Videoモデル:**テキストプロンプトと1枚の画像に基づいて特定の人物の動画を生成し、その人物の外見を維持します。
- **Movie Gen Editモデル:**実写および架空の動画をテキストベースで詳細に編集できるモデルです。
Meta Movie Gen Videoモデルの学習#
Movie Gen Videoモデルの作成と学習には、いくつかの重要なプロセスが関わっていました。最初の段階では、主に人間の活動を捉えた画像や動画クリップなどの視覚データを収集・準備し、品質、動き、関連性に基づいてフィルタリングしました。次に、各シーンで何が起きているかを説明するテキストキャプションをデータに付加しました。MetaのLLaMa3-Videoモデルを使用して生成されたキャプションは、各シーンの内容を詳しく説明し、モデルのビジュアルストーリーテリング能力を高めました。

図3。Movie Gen Videoモデルの事前学習データキュレーションパイプラインの概要です。
学習プロセスは、モデルがテキストを低解像度の画像に変換する方法を学ぶことから始まりました。その後、ますます高品質なビジュアルを使用し、テキストから画像およびテキストから動画への学習を組み合わせることで、動画クリップ全体を作成する段階へと進みました。
Temporal Autoencoder(TAE)と呼ばれるツールで動画を圧縮し、大量のデータを効率的に処理しました。ファインチューニングによって動画品質をさらに向上させ、モデル平均化と呼ばれる手法(複数のモデル出力を組み合わせて、より滑らかで一貫した結果を得る手法)によって出力の一貫性を高めました。最後に、当初768pだった動画を、空間アップサンプラー技術を使用して鮮明な1080p解像度にアップスケールしました。この技術は、ピクセルデータを追加して画像解像度を高め、より鮮明なビジュアルを実現します。その結果、高品質で詳細な動画出力が得られました。
Meta Movie Genの機能を探る#
Meta Movie Genモデルは、主に4つの異なる機能をサポートしています。それぞれについて詳しく見ていきましょう。
動画および音声の生成#
Meta Movie Genは高品質な動画を生成できます。これらの動画クリップは最長16秒で、16 fps(1秒あたりのフレーム数)で再生されます。テキストプロンプトから、動き、相互作用、カメラアングルを捉えたリアルなビジュアルを作成できます。130億パラメータの音声モデルと組み合わせることで、ビジュアルに合った環境音、フォーリー効果音、音楽などの同期音声も生成できます。
この構成により、さまざまなシーンやプロンプトにわたって、ビジュアルと音声の両方が整合し、リアルに保たれた、シームレスで生き生きとした体験を実現できます。例えば、これらのモデルは、Moo Dengと名付けられた、タイで話題になったコビトカバの動画クリップの作成に使用されました。

図4。MetaのMovie Genを使用して作成されたMoo Dengの動画クリップのフレームです。
パーソナライズされた動画生成#
Meta Movie Genモデルのもう1つの興味深い機能は、パーソナライズされた動画生成です。ユーザーは、人物の画像と動画クリップの生成方法を説明するテキストプロンプトを入力できます。これにより、参照した人物を含み、テキストプロンプトで指定された豊かな視覚的ディテールを取り入れた動画が生成されます。モデルは両方の入力(画像とテキスト)を使用して、その人物固有の外見と自然な身体の動きを維持しながら、プロンプトで説明されたシーンを正確に再現します。

図5。モデルのパーソナライズされた動画生成機能の例です。
精密な動画編集#
Movie Gen Editモデルを使用すると、ユーザーは動画クリップとテキストプロンプトの両方を入力して、動画をクリエイティブに編集できます。モデルは動画生成と高度な画像編集を組み合わせ、要素の追加、削除、置換など、非常に具体的な編集を実行します。また、動画クリップの背景や全体的なスタイルの変更など、全体に関わる変更も行えます。しかし、このモデルを本当に特徴づけているのはその精度です。編集が必要な特定のピクセルだけを対象にし、残りの部分には変更を加えません。これにより、元のコンテンツを可能な限り維持できます。

図6。Movie Gen Editモデルの動画編集機能のさまざまな例です。
Meta Movie Genのベンチマークツール#
生成AIモデルとともに、MetaはMovie Gen Benchも発表しました。これは生成AIモデルの性能をテストするベンチマークツール群です。主なツールとして、Movie Gen Video BenchとMovie Gen Audio Benchの2つが含まれています。どちらも動画および音声生成の異なる側面をテストするよう設計されています。
両方のツールを簡単に見てみましょう。
- Movie Gen Video Bench:人間の活動、動物、自然風景、物理現象、さらに珍しい対象や活動など、幅広いテストカテゴリを網羅する1,003個のプロンプトで構成されています。この評価ベンチマークが特に有用なのは、動きのレベルを網羅している点です。これにより、動画生成モデルを、テンポの速いシーケンスと遅いシーケンスの両方でテストできます。
- **Movie Gen Audio Bench:**527個のプロンプトを用いて、音声生成機能をテストするよう設計されています。これらのプロンプトは生成動画と組み合わせられ、モデルが効果音や音楽をビジュアルコンテンツとどの程度同期できるかを評価します。

図7.図は評価プロンプトの内訳を示しており、左側に概念の一覧、右側に頻繁に使用される名詞と動詞のワードクラウドが表示されています。
Meta Movie Genの実用的な用途#
Meta Movie Genモデルとは何か、どのように機能するかを説明したところで、実用的な用途の1つを見てみましょう。
映画制作におけるMovie GenのAIイノベーション#
MetaのMovie Genで最も期待される用途の1つは、AIを活用した動画および音声制作によって映画制作を変革できることです。Movie Genを使用すると、クリエイターはシンプルなテキストプロンプトから高品質なビジュアルとサウンドを生成でき、ストーリーを伝える新たな方法が開かれます。
実際、MetaはBlumhouseおよび映画制作者のグループと協力し、Movie Genがクリエイティブプロセスをどのように支援できるかについて意見を集めました。Aneesh Chaganty、Spurlock Sisters、Casey Affleckなどの映画制作者が、ムード、トーン、ビジュアルの方向性を捉えるツールの能力をテストしました。彼らは、モデルが新鮮なアイデアを生み出すきっかけになることを発見しました。
このパイロットプログラムから、Movie Genは従来の映画制作に取って代わるものではない一方で、監督にビジュアル要素や音声要素を迅速かつクリエイティブに試す新しい方法を提供することが明らかになりました。映画制作者たちは、ツールの編集機能によって、背景音、効果音、ビジュアルスタイルをより自由に試せる点も高く評価しました。

図8。Meta Movie Genを使用して制作された短編映画のフレームです。
主なポイント#
Meta Movie Genは、シンプルなテキスト説明から高品質な動画や音声を作成するための生成AI活用を前進させるものです。このツールにより、ユーザーはリアルでカスタマイズされた動画を簡単に作成できます。精密な動画編集やパーソナライズされたメディア生成などの機能を備えたMeta Movie Genは、ストーリーテリング、映画制作などに新たな可能性をもたらす柔軟なツールセットを提供します。詳細で実用的なビジュアルをより簡単に作成できるようにすることで、Meta Movie Genはさまざまな分野における動画の制作方法と利用方法を変革し、AIを活用したコンテンツ制作の新たな基準を打ち立てています。
詳しくは、GitHubリポジトリをご覧いただき、コミュニティにご参加ください。ソリューションページでは、自動運転車や農業におけるAIアプリケーションをご覧いただけます。🚀









