使用 Google DeepMind 的 Veo 生成视频
进一步了解 Google DeepMind 的 Veo,这款最新的生成式视频模型可以根据文本、图像和视频提示,轻松生成高质量的 1080P 视频。

在 5 月 14 日举行的 Google 2024 I/O 演讲中,他们分享了 DeepMind(其 AI 部门)的最新进展。其中最令人兴奋的进展之一,是他们最新的生成式视频模型 Veo。Veo 可以根据文本、图像和视频提示生成高质量的 1080P 视频。它甚至支持通过后续提示编辑生成的视频。Veo 将生成式 AI 带入了新的阶段。下面让我们仔细了解 Veo 提供的功能。
了解 Veo 的功能#
Veo 是一种生成式视频模型,能够深入理解语言和视觉内容,生成与用户创意构想高度匹配的视频。它可以准确捕捉较长提示中的语气和细节,是希望将想法转化为精确视频内容的创作者的强大工具。
由于 Veo 能够理解“timelapse”和“aerial shots of a landscape”等电影拍摄手法,用户可以对生成的视频进行突破性的创意控制。这种创意控制让用户能够创建人物、动物和物体自然运动的视频。Veo 生成的视频引人入胜且具有视觉吸引力,因为很难看出它们是由 AI 模型生成的。
Veo 不仅仅能根据提示创建视频。如果你提供一个之前生成的视频和具体的编辑请求,例如在海岸线的航拍画面中加入皮划艇,Veo 就能将这一变化无缝融入原始视频,生成更新后的版本。

图 1:使用 Veo 进行视频编辑的示例。
以下是 Veo 提供的更多功能:
- 蒙版编辑:Veo 可以帮助你编辑视频中的指定区域。
- 图像启发式视频生成:使用图像和文本提示,Veo 可以生成与图像风格相似并遵循提示指示的视频。
- 扩展视频片段:Veo 可以将视频片段创建并扩展到 60 秒或更长时间,既可以根据单个提示生成,也可以根据共同讲述一个故事的一系列提示生成。
Veo 生成的精彩视频#
让我们一起看看 Veo 生成的一些视频,以及它们为何如此令人惊叹。
仅根据简短的文本提示生成延时摄影视频颇具挑战。通常,简短的文本提示无法准确传达延时摄影场景中的变化和运动。因此,Veo 无需详细说明就能理解延时摄影应呈现的内容,着实令人惊叹。

图 2:Veo 生成的延时摄影视频中的一帧。
同样,生成符合真实物理规律的视频也并不容易。AI 模型需要理解并模拟重力、动量和碰撞等物理定律,才能让运动和交互看起来真实。Veo 无需文本提示提供详细指导,就能准确建模这些动态效果,这一点令人印象深刻。

图 3:使用 Veo 生成的视频中的一帧,准确捕捉了水母运动的物理规律。
由于计算限制以及在较长序列中保持连贯性的复杂性,此前我们只能看到 AI 生成的较短视频。在 Google 2024 I/O 演讲中,Veo 展示了其创建更长、更复杂视频的惊人能力。

图 4:Google 2024 I/O 演讲中展示的较长 Veo 视频中的画面。
Veo 如何工作?#
与许多其他 AI 模型一样,Veo 站在巨人的肩膀上。它借鉴了生成式查询网络(GQN)、DVD-GAN、Imagen-Video、Phenaki、WALT、VideoPoet 和 Lumiere 等此前的进展,以及 Google 专有的 Transformer 架构和 Gemini。此外,为了提升 Veo 准确解读提示的能力,其训练数据集中每个视频的描述都更加详细。
根据 Google 分享的粗略模型工作流程,Veo 的工作方式如下:
- 输入提示:你提供文本提示,也可以选择提供图像提示。
- 编码:文本提示由 UL2 Encoder 处理,图像提示由图像编码器处理。
- 嵌入提示:文本编码器和图像编码器的输出会合并,形成一个嵌入提示。
- 潜在扩散模型:嵌入提示和带噪压缩视频会传入该模型,由模型利用它们生成压缩视频。Veo 使用称为潜变量的高质量压缩视频表示,在保持质量的同时提高效率。
- 解码:最后一步会从压缩视频中解码出 1080p 视频输出。

图 5:Veo 的工作原理。
电影制作领域的一个有说服力的案例研究#
为了测试 Veo 的能力,Google 与电影制作人 Donald Glover 及其创意工作室 Gilga 展开合作。他们使用 Veo 探索了各种创意技术,包括动态跟踪镜头;这类镜头需要精准的运动和稳定的构图。

图 6:在电影制作流程中使用 Veo。
传统上,电影制作人会受到时间和资源限制。借助 Veo,Glover 和他的团队可以快速尝试并生成复杂镜头,从而在电影制作过程中获得更大的灵活性和创新空间。
借助 Veo,Glover 和他的团队可以在实际拍摄前快速尝试并生成复杂镜头。例如,他们可以测试各种动态跟踪镜头,查看效果并根据需要进行调整。这一预可视化流程帮助他们完善创意,确保镜头能够按预期呈现,最终减少实际拍摄所需的镜头次数。他们成功打造了一个有说服力的案例研究,展示 Veo 改变电影行业的潜力。它提供了一种更快速、更高效的方式,将创意构想变为现实。
Veo 在各行业的实际应用#
Veo 的先进视频生成功能可在众多行业中发挥实际作用。在广告行业,它可以快速为目标受众制作定制化的高质量广告,节省时间和制作成本。在教育领域,Veo 可以创建引人入胜的教学视频,让复杂概念更易于理解。
企业可以使用 Veo 进行培训和企业沟通。医疗保健专业人员可以使用 Veo 模拟医疗流程,用于培训。对于虚拟活动和会议,Veo 可以创建场地和舞台的逼真模拟,让参会者无论身在何处都能获得引人入胜的互动体验。组织者则能扩大覆盖范围,并获得对未来活动有价值的洞察。得益于 Veo,无数机会由此开启。
当 AI 模型有潜力触及不同的行业时,务必牢记 AI 的安全性和伦理问题。为了推动更广泛的应用并确保负责任地使用,Google 实施了多项安全措施。Veo 创建的视频会使用 SynthID 添加水印,SynthID 是一种用于为 AI 生成内容添加水印并进行识别的工具。SynthID 确保透明度,并帮助降低隐私、版权和偏见风险。此外,所有生成的视频都会经过安全过滤器和记忆检查流程。这些防护措施使 Veo 成为支持负责任且创新的视频制作的有价值的合伦理工具。
在哪里使用 Veo#
未来几周内,Google 将通过 VideoFX 向部分受邀创作者提供 Veo 的一些突破性功能。VideoFX 是一款可在 labs.google 使用的新工具。这项计划让用户能够提前体验 Veo 的先进视频生成功能,为创作者提供探索其创新功能的机会。Veo 等候名单目前已开放,感兴趣的创作者可以报名,将 Veo 的强大工具用于自己的项目。
更多关于 DeepMind 2024 年生成式 AI 更新的信息#
除了 Veo 之外,DeepMind 还在 2024 年推出了多项生成式 AI 前沿更新。其中一项是 Imagen 3,这是他们迄今最先进的文本到图像模型。Imagen 3 擅长创建逼真、栩栩如生的图像。它能够深入理解自然语言提示,在减少视觉伪影的同时捕捉复杂细节。

图 7:使用 Imagen 3 生成的图像。
DeepMind 还开发了 Lyria,这是其最先进的 AI 音乐生成模型。作为这项工作的一部分,DeepMind 创建了一套名为 Music AI Sandbox 的音乐 AI 工具。这些工具让音乐家和制作人能够探索音乐创作与声音转换中的全新创意可能性。

图 8:DeepMind AI 音乐工具的界面示例。
与 Veo 类似,DeepMind 也针对其其他更新实施了多项安全措施。SynthID 将用于这些更新,作为为 AI 生成内容添加水印并进行识别的工具。DeepMind 的这些更新承诺通过提供先进、高效且负责任的工具,改变各个行业创建高质量视觉和音频内容的方式。
探索生成式 AI 的下一阶段#
DeepMind 在 2024 年取得的生成式 AI 进展,包括 Veo、Imagen 3 和 Lyria,标志着 AI 能力的一次巨大飞跃。Veo 能够根据简单提示生成高质量的 1080p 视频,改变了视频创作方式,成为电影制作人和内容创作者的多用途工具。Imagen 3 在生成逼真图像方面表现出色,而 Lyria 则借助先进的 AI 工具,为音乐生成带来了新的可能性。
这些技术有望通过提供高效且负责任的工具,改变各个行业创建高质量视觉和音频内容的方式。凭借 SynthID 等确保合伦理使用的安全措施,DeepMind 不断拓展 AI 的边界,为未来的创新应用铺平道路。
访问我们的 GitHub 代码库并加入我们的社区,深入探索 AI。浏览我们的解决方案页面,了解 AI 如何应用于制造业和农业。









