Ultralytics YOLO27:
视觉 AI

Google Genie 3 通过 AI 让你的 3D 世界栩栩如生

DeepMind 的 Genie 3 AI 世界模型可将文本或图像提示转换为 3D 环境。这一进展标志着其向类人智能又迈进一步。

ABAbirami Vina5 min read
Google DeepMind Genie 3 生成 3D 世界

2025 年 8 月 5 日,Google DeepMind 发布了最新版本的 Genie 模型,即 Genie 3。这是一种新的 AI 模型,可以将用户的文本提示转换为动态的交互式环境。

这些环境,也就是 AI 世界,让用户能够像在电子游戏中一样实时导航和与其互动。用户还可以通过提供额外的文本提示来扩展或修改环境,从而无需重启模拟即可即时进行更改。

最新的 Genie Google 模型之所以特别重要,是因为它可以用于训练 AI 代理。这包括教会 AI 代理 使用数据和反馈做出决策或执行任务。通过使用模拟的 3D 环境代替现实世界,研究人员可以避免现实训练中的许多挑战、成本和风险。

Google Genie 3 还可以模拟复杂场景,例如测试自动驾驶汽车在恶劣天气中行驶,或测试翼装飞行者在山地地形中滑翔。

在本文中,我们将探索 Google Genie 3 及其功能。让我们开始吧!

展示翼装飞行者滑翔的 Genie 3 模拟画面

图 1. 展示翼装飞行者滑翔的 Genie 3 模拟画面。(来源

Google Genie 模型简史#

在深入了解 Google DeepMind 的 Genie 模型之前,让我们先更好地了解什么是世界模型。

世界模型是从文本、图像、视频和运动数据集中学习物理、运动和空间关系等现实世界规律的 AI 系统。这使它们能够创建逼真的场景,并预测场景如何演变。Genie 模型就是此类系统的例子。

下面快速了解一下为 Genie 3 铺平道路的早期 Google Genie 模型:

  • Genie 1: Genie 1 通常简称为 Google Genie,是 Google DeepMind 首个能够创建交互式虚拟环境的 AI 世界模型。用户可以用文本、图像、照片甚至草图描述一个世界,Genie 会生成该世界,并让用户控制场景中的动作。它旨在随时间处理视频数据、预测下一帧,并将用户输入转换为世界内的动作。

  • Genie 2: Genie 2 在 Google Genie 的功能基础上进行了扩展,可以创建各种详细的交互式 3D 世界。作为世界模型,它能够模拟虚拟环境,并对跳跃、游泳或移动物体等动作做出逼真响应。它使用海量视频集合进行训练,具备逼真的物体交互和栩栩如生的角色动作。

什么是 Genie 3?Google 的新 AI 模型#

在早期 Genie 模型的基础上,Genie 3 是该系列最新、最先进的模型。它尤其基于能够生成新虚拟环境的 Genie 2,以及 Google DeepMind 最新的视频生成模型 Veo 3 构建。Veo 3 展现了对物理规律以及物体在现实世界中如何交互的深入理解。

Veo 3 使用硬编码的物理引擎,而 Google Genie 3 则通过一种称为自监督学习的方法自行学习物理规律。这是一种AI 学习技术,AI 模型通过生成自己的学习信号,从无标注数据中学习模式和关系。

Google Genie 3 的自监督学习能力对于训练 AI 系统(例如 AI 代理或 AI 机器人)以处理各种任务至关重要。事实上,Google DeepMind 的研究人员认为,Genie 3 是迈向创建人工通用智能 (AGI)的重要一步。

Genie 3 模拟控制机器人漫游车

图 2. 使用 Google Genie 3 模拟控制机器人漫游车的示例。(来源

AGI 是一种理论上的 AI 形态,能够理解和学习任何任务或主题,并像人类一样将这些知识应用于不同情境。与如今针对特定任务构建、难以将技能迁移到新问题上的人工智能模型不同,AGI 将能够在广泛的环境中适应和学习。

Google Genie 3 构建 AI 世界的主要功能#

以下是 Genie 3 支持的一些主要功能:

  • 文本生成 3D 世界: 它可以将简单的文本提示(例如“一个机器人沿街行走”)转换为带有基本移动控制功能的可玩类 3D 环境。

  • 可通过提示控制的世界事件: 用户可以通过输入新命令(例如“给街道添加降雨”)动态改变环境。

  • 视觉记忆: Genie 3 可以记住留在环境中的物体,并让你稍后重新访问这些物体,记忆时长约为一分钟。

  • 流畅且一致的视频输出: 它可以保持 720p 分辨率下 24 fps(每秒帧数)的视频输出,持续交互时间比 Genie 2 更长。

Genie 3 生成比 Genie 2 持续时间更长的输出

图 3. Google Genie 3 可以生成比 Genie 2 生成的输出持续时间更长的内容。(来源

从教育到游戏:Google DeepMind Genie 3 的应用#

Google Genie 3 可以让学习、研究和训练更加沉浸和引人入胜。例如,在课堂上,它可以让学生探索古代城市或穿越太空,使历史、科学或地理知识栩栩如生。同样,对于人工智能开发者来说,它提供了逼真的虚拟世界,用于练习策略、应对挑战和提升决策能力。

科学家还可以使用它创建受控模拟,用于测试想法、研究生态系统或观察物体的行为。另一个有趣的应用领域是视频游戏开发。游戏开发者可以将文本提示转换为详细的游戏世界,从而加快开发速度,并减少对大型团队的需求。

使用 Genie 3 设计的彩色交互式游戏

图 4. 使用 Genie 3 可以设计有趣、色彩丰富且具交互性的游戏。(来源

Google Genie 3 作为世界模型的局限性#

虽然 Google Genie 3 提供了许多功能和优势,但考虑它的缺点也很重要。

以下是需要考虑的一些局限性:

  • 动作范围有限: 虽然你可以触发虚拟世界中的许多事件,但并非所有事件都由代理自身执行。代理能够直接执行的动作仍然有限。

  • 与其他代理交互: 在同一环境中创建多个独立代理之间的逼真交互仍在持续完善中。

  • 现实世界准确性: Google Genie 3 目前还无法以完美的地理精度重现现实世界中的地点。

要点总结#

Google Genie 3 代表了使用 AI 创建逼真交互式 3D 世界的一项重大进展。它可以通过简单的文本提示让想法成为现实、模拟物理规律,甚至在安全的虚拟空间中训练 AI 系统。

虽然它仍存在局限,但也为研究、游戏和 AI 开发带来了许多可能性。它还是迈向能够以更接近人类的方式思考和学习的 AGI 系统的关键一步。

查看我们的 GitHub 代码仓库,了解更多 AI 相关信息。加入活跃的社区,探索零售业中的 AI制造业中的视觉 AI等领域的创新。要立即开始使用计算机视觉,请查看我们的许可选项

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅