World Models
探索世界模型如何利用环境动态帮助 AI 预测未来状态。了解 Ultralytics YOLO26 如何为预测式 AI 提供感知能力。
“世界模型”是指 AI 系统对环境运作方式的内部表征,使其能够根据当前观察和可能采取的行动预测未来状态或结果。传统模型会将输入直接映射为输出(例如对图像进行分类),而世界模型会学习系统底层的动态、物理规律和因果关系。这一概念对于推动通用人工智能 (AGI)至关重要,因为它赋予机器某种“常识”推理能力,使机器能够在现实世界中采取行动之前先在内部模拟各种情景。
世界模型背后的机制#
从本质上说,世界模型的运作方式类似于人类直觉。你扔球时,不会计算空气阻力方程;你的大脑会根据过去的经验模拟球的轨迹。同样,在机器学习 (ML)中,这些模型会将高维感官数据(例如视频帧)压缩为紧凑的潜在状态。经过压缩的状态让智能体能够高效地“幻想”或预测可能的未来。
Ha 和 Schmidhuber 关于循环世界模型的研究等前沿成果,展示了智能体如何完全在模拟的梦境环境中学习策略。近年来,OpenAI 的 Sora 等生成式 AI进展代表了一种视觉形式的世界建模,系统能够理解物理规律、光照和物体恒存性,从而生成连贯、连续的视频。
在机器人与仿真中的应用#
世界模型在需要复杂决策的领域尤其具有变革性。
- 自动驾驶汽车:自动驾驶汽车利用世界模型预测其他驾驶员和行人的行为。通过每秒模拟数千种可能的交通场景,车辆可以选择最安全的路线。这与汽车解决方案中的计算机视觉密切相关,因为准确的感知是预测的基础。
- 机器人:在制造业机器人领域,使用世界模型训练的机械臂可以适应新物体或意外障碍,而无需重新训练。它能够理解抓取和移动的物理规律,从而改进智能制造解决方案。
世界模型与标准强化学习#
区分世界模型与标准方法很有帮助:
- 世界模型与强化学习 (RL):传统 RL 通常是“无模型”的,也就是说,智能体完全通过在环境中反复试错来学习。世界模型方法则是“基于模型”的,智能体会构建一个模拟器并从中学习,从而大幅减少所需的现实世界交互次数。
- 世界模型与大型语言模型 (LLMs):LLM 会预测下一个文本词元,而世界模型通常会预测下一视觉帧或状态。不过,随着多模态学习兴起,二者的界限正逐渐模糊,因为模型会整合文本、视觉和物理信息。
实践实现概念#
虽然构建完整的世界模型很复杂,但其基础概念是预测未来状态。对于计算机视觉任务,高速检测模型(例如 Ultralytics YOLO26)可充当感知“眼睛”,将观察结果输入决策逻辑。
下面的 Python 代码片段演示了如何使用 YOLO 模型提取当前状态(物体位置),并将其用作世界模型预测步骤的输入。
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to get the current state of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding boxes (xyxy) representing object states
for result in results:
boxes = result.boxes.xyxy.cpu().numpy()
print(f"Observed State (Object Positions): {boxes}")
# A World Model would take these 'boxes' to predict the NEXT frame's state预测式 AI 的未来#
世界模型正朝着物理 AI发展,让数字智能能够与物理世界无缝交互。像 Yann LeCun 的 JEPA(联合嵌入预测架构)这样的创新,提出学习抽象表征而非预测每个像素,从而显著提高模型效率。
随着这些架构日渐成熟,我们预计它们将集成到 Ultralytics Platform 中,让开发者不仅能检测物体,还能预测物体在动态环境中的轨迹和交互。这种从静态检测转向动态预测的变化,标志着计算机视觉 (CV)迈入下一个重大阶段。









