Google DeepMindのVeoで動画を生成する
テキスト、画像、動画のプロンプトから高品質な1080P動画を容易に生成できる、Google DeepMindの最新の生成動画モデルVeoについて詳しく学びます。

5月14日に行われたGoogleの2024年I/Oの発表で、GoogleはAI部門であるDeepMindの最新情報を共有しました。共有された最も注目すべき進展の一つが、最新の生成動画モデルであるVeoです。Veoは、テキスト、画像、動画のプロンプトに基づいて高品質な1080P動画を作成できます。さらに、後続のプロンプトを使って生成済みの動画を編集することもできます。Veoは生成AIを次の段階へと引き上げます。Veoが提供する機能を詳しく見ていきましょう。
Veoの機能を理解する#
Veoは、言語と視覚を深く理解し、ユーザーのクリエイティブなビジョンに忠実な動画を作成する生成動画モデルです。長いプロンプトのトーンや細部を正確に捉えられるため、アイデアを精密な動画コンテンツへ変換したいクリエイターにとって強力なツールとなります。
Veoは「タイムラプス」や「風景の空撮」のような映像技法を理解できるため、ユーザーは生成動画を画期的に細かく制御できます。このクリエイティブな制御により、人、動物、物体が自然に動く動画を作成できます。Veoが生成した動画は、AIモデルによる生成だと見分けるのが難しいため、魅力的で視覚的にも印象的です。
Veoは、単にプロンプトから動画を作成するだけではありません。生成済みの動画と、海岸線の空撮映像にカヤックを追加するなどの具体的な編集リクエストを入力すると、Veoはその変更を元の動画にシームレスに組み込み、更新版を生成できます。

図1. Veoを使用した動画編集の例。
Veoが提供するその他の機能を紹介します。
- マスク編集:Veoは、動画内の指定した領域を編集できます。
- 画像に基づく動画作成:画像とテキストプロンプトを使用すると、Veoは画像のスタイルを反映し、プロンプトの指示に従った動画を生成できます。
- 長尺動画クリップ:Veoは、1つのプロンプトまたは一連のプロンプトから、ストーリーを構成しながら、最大60秒以上の動画クリップを作成・拡張できます。
Veoが生成した息をのむような動画#
Veoが生成した動画のいくつかを見ながら、なぜそれほど息をのむような映像なのかを確認しましょう。
短いテキストプロンプトからタイムラプス動画を生成するのは困難です。通常、短いテキストプロンプトでは、タイムラプスのシーン内で起こる変化や動きを正確に伝えられません。そのため、詳細を指定しなくてもタイムラプスで何が起こるかをVeoが理解できることは驚くべきことです。

図2. Veoが生成したタイムラプス動画の1フレーム。
同様に、正確な物理法則に基づく動画を生成するのも簡単ではありません。AIモデルは、動きや相互作用を現実的に見せるために、重力、運動量、衝突などの物理法則を理解してシミュレートする必要があります。テキストプロンプトによる詳細な指示がなくても、Veoがこうした力学を正確にモデル化できるのは印象的です。

図3. Veoが生成した動画の1フレームで、クラゲの動きに関する物理法則を正確に捉えています。
これまでは、計算上の制約や長いシーケンス全体で一貫性を維持する複雑さから、AIが生成する動画は短いものに限られていました。Googleの2024年I/O発表では、より長く複雑な動画を作成できるVeoの驚異的な能力が示されました。

図4. Googleの2024年I/O発表で紹介された長尺Veo動画のフレーム。
Veoはどのように動作するのでしょうか?#
他の多くのAIモデルと同様に、Veoも先人たちの成果の上に成り立っています。Generative Query Network (GQN)、DVD-GAN、Imagen-Video、Phenaki、WALT、VideoPoet、Lumiereなどの従来の進歩に加え、Google独自のTransformerアーキテクチャとGeminiを活用しています。さらに、プロンプトを正確に解釈するVeoの能力を向上させるため、トレーニングデータセット内の各動画のキャプションはより詳細なものになっています。
Googleが共有した大まかなモデルワークフローに基づくと、Veoは次のように動作します。
- 入力プロンプト:テキストプロンプトを入力し、必要に応じて画像プロンプトも入力します。
- エンコーディング:テキストプロンプトはUL2エンコーダーで処理され、画像プロンプトは画像エンコーダーで処理されます。
- 埋め込みプロンプト:テキストエンコーダーと画像エンコーダーの出力を組み合わせ、1つの埋め込みプロンプトを形成します。
- 潜在拡散モデル:埋め込みプロンプトとノイズを含む圧縮動画がこのモデルに入力され、それらを使用して圧縮動画が生成されます。Veoは、品質を維持しながら効率を高めるため、潜在表現(latent)と呼ばれる高品質な圧縮動画表現を使用します。
- デコーディング:最後のステップでは、圧縮動画から1080pの動画出力をデコードします。

図5. Veoの動作。
映画制作における説得力のあるケーススタディ#
Veoの能力を試すため、Googleは映画監督のDonald Gloverと、彼のクリエイティブスタジオであるGilgaと協力しました。両者はVeoを使用して、正確な動きと一貫したフレーミングが必要なダイナミックトラッキングショットなど、さまざまなクリエイティブ技法を検証しました。

図6. 映画制作プロセスでのVeoの使用。
従来、映画制作者は時間とリソースの制約による限界に直面していました。Veoを使うことで、Gloverとチームは複雑なショットをすばやく試作・生成でき、その結果、映画制作プロセスにおける柔軟性と革新性が高まりました。
Veoを使うことで、Gloverとチームは実際の撮影前に複雑なショットをすばやく試作・生成できました。たとえば、さまざまなダイナミックトラッキングショットを試して見え方を確認し、必要に応じて調整できました。このプリビジュアライゼーションのプロセスにより、アイデアを洗練し、ショットが意図どおりに機能することを確認できたため、実際の撮影で必要なテイク数を最終的に減らせました。両者は、Veoが映画業界を変える可能性を示す説得力のあるケーススタディを作成できました。Veoは、クリエイティブなビジョンをより迅速かつ効率的に形にする方法を提供します。
さまざまな業界におけるVeoの実用例#
Veoの高度な動画生成機能は、多くの業界で実用化できます。広告分野では、ターゲット層向けにカスタマイズした高品質な広告動画をすばやく制作し、時間と制作コストを削減できます。教育分野では、Veoが魅力的な教育用動画を作成し、複雑な概念を理解しやすくできます。
企業は、Veoを研修や企業コミュニケーションに活用できます。医療従事者は、研修目的で医療処置をシミュレートするためにVeoを使用できる可能性があります。バーチャルイベントやカンファレンスに関しては、Veoによって会場やステージのリアルなシミュレーションを作成でき、参加者はどこからでも魅力的でインタラクティブな体験を得られます。主催者は、リーチの拡大と今後のイベントに役立つ貴重なインサイトというメリットを得られます。Veoによって、数え切れないほどの可能性が広がりました。
AIモデルがさまざまな業界に影響を与える可能性を持つ場合、安全性と倫理的なAIを念頭に置くことが重要です。より幅広い導入を可能にし、責任ある利用を確保するため、Googleはいくつかの安全対策を実施しています。Veoが作成した動画には、AI生成コンテンツの透かし付与と識別のためのツールであるSynthIDを使って電子透かしが付けられます。SynthIDは透明性を確保し、プライバシー、著作権、バイアスに関するリスクの軽減に役立ちます。これに加えて、生成されたすべての動画は安全性フィルターと記憶化チェックのプロセスを通過します。こうした保護策により、Veoは責任ある革新的な動画制作を支援する、価値があり倫理的なツールとなっています。
Veoにアクセスする方法#
今後数週間以内に、Googleはlabs.googleで利用できる新しいツールVideoFXを通じて、Veoの画期的な機能の一部を選ばれたクリエイターに提供し始める予定です。この取り組みにより、Veoの高度な動画生成機能を早期に利用でき、クリエイターは革新的な機能を試せるようになります。Veoのウェイトリストは現在受付中で、関心のあるクリエイターは登録して、プロジェクトでVeoの強力なツールを利用できます。
DeepMindの2024年生成AIアップデートの詳細#
Veo以外にも、DeepMindは2024年に生成AI分野で最先端のアップデートをいくつか発表しました。その一つが、これまでで最も高度なテキスト画像変換モデルであるImagen 3です。Imagen 3は、フォトリアルで生き生きとした画像の作成に優れています。自然言語のプロンプトを深く理解し、視覚的なアーティファクトを抑えながら、複雑な細部を捉えます。

図7. Imagen 3を使用して生成された画像。
DeepMindは、AI音楽生成向けの最も高度なモデルであるLyriaも開発しました。この取り組みの一環として、DeepMindはMusic AI Sandboxという音楽AIツール群を作成しました。これらのツールにより、ミュージシャンやプロデューサーは、作曲やサウンド変換における新たなクリエイティブの可能性を探求できます。

図8. DeepMindのAI音楽ツールのUI例。
Veoと同様に、DeepMindは他のアップデートについてもいくつかの安全対策を実施しています。これらのアップデート全体で、AI生成コンテンツの透かし付与と識別のためのツールとしてSynthIDが使用されます。DeepMindのこれらのアップデートは、高品質なビジュアルおよびオーディオコンテンツを作成するための高度で効率的かつ責任あるツールを提供し、さまざまな業界を変革することが期待されています。
生成AIの次の段階を切り開く#
Veo、Imagen 3、Lyriaを含むDeepMindの2024年の生成AIの進歩は、AIの能力を大きく飛躍させるものです。Veoは、単純なプロンプトから高品質な1080p動画を生成できるため、動画制作のあり方を変革し、映画制作者やコンテンツクリエイターにとって多用途なツールとなります。Imagen 3はフォトリアルな画像の生成に優れ、Lyriaは高度なAIツールによって音楽生成の新たな可能性を切り開きます。
これらのテクノロジーは、高品質なビジュアルおよびオーディオコンテンツを作成するための効率的で責任あるツールを提供し、さまざまな業界を変革することが期待されています。SynthIDのような安全対策によって倫理的な利用が確保される中、DeepMindはAIの可能性を広げ続け、将来の革新的なアプリケーションへの道を切り開いています。
GitHubリポジトリを訪問してAIの世界に飛び込み、コミュニティに参加しましょう。製造や農業でAIがどのように活用されているかを知るには、ソリューションページをご覧ください。









