Ultralytics YOLO27:
视觉 AI

Meta Movie Gen:重新构想内容创作

了解 Meta Movie Gen 如何重新定义视频和声音创作。了解该模型如何实现精准的视频编辑,并支持个性化媒体创作。

ABAbirami Vina6 min read
Meta Movie Gen AI 视频创作

无论你是有志成为电影制作人,还是喜欢为受众制作视频的内容创作者,拥有能够拓展创意的 AI 工具总是很有帮助。最近,Meta 发布了其最新的生成式视频模型,名为 Meta Movie Gen。

全球媒体和娱乐领域的生成式 AI 市场预计到 2033 年将达到 115.7 亿美元,Runway、OpenAIMeta 等公司正引领突破性创新。尤其是 Meta Movie Gen,非常适合电影制作、视频内容创作和数字叙事等应用,让你可以通过高质量的 AI 生成视频,比以往更轻松地将创意构想变为现实。在本文中,我们将探索 Meta Movie Gen 及其工作原理,并进一步了解它的一些应用。让我们开始吧!

使用 Meta Movie Gen 生成的视频片段画面

图 1。使用 Meta Movie Gen 生成的视频片段画面。

什么是 Meta Movie Gen?#

在讨论 Meta Movie Gen 是什么之前,我们先来看看它是如何诞生的。

Meta 在生成式 AI 方面的研究始于其 Make-A-Scene 系列模型。这项研究聚焦于一种多模态生成式 AI 方法,帮助艺术家和创意人士将想象变为现实。艺术家可以输入图像、音频、视频或 3D 动画,以获得所需的图像输出。随后,扩散模型带来了下一轮创新,例如 Llama Image Foundation 模型(Emu),使生成质量更高的图像和视频成为可能,并支持图像编辑。

使用 Make-A-Scene 草图和文本输入生成图像

图 2。使用 Make-A-Scene 的草图和文本输入生成图像的示例。

Movie Gen 是 Meta 在生成式 AI研究领域的最新成果。它融合了前面提到的所有模态,并支持更精细的控制,让人们能够以更具创意的方式使用这些模型。Meta Movie Gen 是一组用于生成不同类型媒体的基础模型,包括文本生成视频、文本生成音频和文本生成图像。它由四个模型组成,这些模型使用获得授权和公开可用的数据集组合进行训练。

下面快速概览这些模型:

  • Movie Gen Video 模型: 一个拥有 300 亿参数、可根据文本提示生成高质量视频的模型。
  • Movie Gen Audio 模型: 一个拥有 130 亿参数、能够创建与视频内容同步的音轨的模型。
  • Personalized Movie Gen Video 模型: 根据文本提示和单张图像生成特定人物的视频,同时保留其外貌特征。
  • Movie Gen Edit 模型: 支持对真实和虚构视频进行详细的文本驱动编辑。

训练 Meta Movie Gen 视频模型#

创建和训练 Movie Gen Video 模型涉及多个关键流程。第一步是收集和准备视觉数据,包括图像和视频片段,主要是经过质量、运动和相关性筛选的人类活动数据。随后,将这些数据与文本说明配对,用于解释每个场景中发生的内容。这些说明由 Meta 的 LLaMa3-Video 模型生成,为每个场景的内容提供丰富细节,从而增强模型的视觉叙事能力。

Movie Gen Video 模型预训练数据流程概览

图 3。Movie Gen Video 模型预训练数据整理流程概览。

训练过程始于让模型学习将文本转换为低分辨率图像。随后,通过结合文本生成图像和文本生成视频训练,并使用质量不断提高的视觉内容,模型进一步生成完整的视频片段。

一种名为时序自动编码器(TAE)的工具将视频压缩,以便高效管理大量数据。微调进一步提升了视频质量,而一种名为模型平均的​​方法(将多个模型的输出结合起来,以获得更平滑、更一致的结果)则确保了更高的输出一致性。最后,视频最初的分辨率为 768p,随后使用空间上采样器技术将其放大到清晰的 1080p 分辨率;该技术通过添加像素数据来提高图像分辨率,从而呈现更清晰的视觉效果。最终生成了高质量、细节丰富的视频输出。

探索 Meta Movie Gen 的能力#

Meta Movie Gen 模型主要支持四种不同的能力。下面让我们分别深入了解。

视频和音频生成#

Meta Movie Gen 可以生成高质量视频。这些视频片段最长可达 16 秒,并以 16 fps(每秒帧数)运行,能够根据文本提示生成捕捉运动、互动和摄像机角度的逼真画面。结合拥有 130 亿参数的音频模型后,它可以生成与画面同步的音频,包括环境音、拟音效果和音乐。

这种设置确保了流畅、逼真的体验,让画面和音频在各种场景与提示下始终保持同步并呈现真实效果。例如,这些模型曾被用于制作泰国网络走红的侏儒河马 Moo Deng 的视频片段。

使用 Meta Movie Gen 制作的 Moo Deng 视频片段画面

图 4。使用 Meta 的 Movie Gen 制作的 Moo Deng 视频片段画面。

个性化视频生成#

Meta Movie Gen 模型的另一项有趣能力是个性化视频生成。用户可以提供一个人的图像以及描述视频片段应如何生成的文本提示,从而得到包含该人物并融入文本提示中丰富视觉细节的视频。模型同时使用这两种输入(图像和文本),在准确遵循提示所描述场景的同时,保留人物独特的外貌和自然的身体动作

模型个性化视频生成能力示例

图 5。模型个性化视频生成能力示例。

精准视频编辑#

使用 Movie Gen Edit 模型时,用户可以同时提供视频片段和文本提示作为输入,以富有创意的方式编辑视频。该模型将视频生成与高级图像编辑相结合,可执行添加、移除或替换元素等非常具体的编辑操作。它还可以执行全局更改,例如修改视频片段的背景或整体风格。但真正让该模型与众不同的是它的精确性:它只会处理需要编辑的特定像素,并保持其余部分不变,从而最大限度地保留原始内容。

Movie Gen Edit 模型视频编辑能力示例

图 6。Movie Gen Edit 模型视频编辑能力的多个示例。

Meta Movie Gen 的基准测试工具#

除了生成式 AI模型外,Meta 还推出了 Movie Gen Bench,这是一套用于测试生成式 AI模型性能的基准测试工具。它包含两个主要工具:Movie Gen Video Bench 和 Movie Gen Audio Bench。两者分别用于测试视频和音频生成的不同方面。

下面简要介绍这两个工具:

  • Movie Gen Video Bench:包含 1003 个提示,涵盖广泛的测试类别,例如人类活动、动物自然景观物理现象,以及不寻常的主题和活动。这项评估基准尤其有价值的一点是覆盖了不同运动水平,确保视频生成模型既能接受快节奏序列的测试,也能接受较慢序列的测试。
  • Movie Gen Audio Bench: 用于通过 527 个提示测试音频生成能力。这些提示会与生成的视频配对,用于评估模型将音效和音乐与视觉内容同步的能力。

Movie Gen Bench 评估提示和词云分解图

图 7。该图展示了评估提示的构成:左侧列出相关概念,右侧显示常用名词和动词的词云。

Meta Movie Gen 的实际应用#

现在我们已经介绍了 Meta Movie Gen 模型是什么以及它们如何工作,接下来探索其中一项实际应用。

电影制作中的 Movie Gen AI 创新#

Meta 的 Movie Gen 最令人兴奋的用途之一,是通过 AI 驱动的视频和音频创作改变电影制作方式。借助 Movie Gen,创作者可以根据简单的文本提示生成高质量的画面和声音,为讲故事开辟新的方式。

事实上,Meta 与 Blumhouse 以及一群电影制作人展开合作,收集他们对 Movie Gen 如何更好地支持创作过程的反馈。Aneesh Chaganty、Spurlock Sisters 和 Casey Affleck 等电影制作人测试了该工具捕捉情绪、基调和视觉方向的能力。他们发现,这些模型有助于激发新想法。

这项试点计划表明,虽然 Movie Gen 无法取代传统电影制作,但它为导演提供了一种快速且富有创意地试验视觉和音频元素的新方式。电影制作人也很欣赏该工具的编辑功能,因为这些功能让他们能够更自由地调整背景声音、效果和视觉风格。

使用 Meta Movie Gen 制作的短片画面

图 8。使用 Meta Movie Gen 制作的短片画面。

要点总结#

Meta Movie Gen 在利用生成式 AI 根据简单的文本描述制作高质量视频和声音方面向前迈进了一步。该工具帮助用户轻松创建逼真且定制化的视频。凭借精准视频编辑和个性化媒体生成等能力,Meta Movie Gen 提供了一套灵活的工具,为讲故事、电影制作及更多领域开辟了新的可能。通过让创建细致且实用的视觉内容变得更加容易,Meta Movie Gen 正在改变各个领域中视频的制作和使用方式,并为 AI 驱动的内容创作树立新的标准。

如需了解更多信息,请访问我们的 GitHub 代码仓库,并加入我们的社区。在我们的解决方案页面上探索 自动驾驶汽车农业领域的 AI 应用。🚀

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅