01 - World Model: 定义、起源与发展史¶
最后更新: 2026-04-14
1. 什么是 World Model?¶
World Model(世界模型)是AI系统内部构建的一种环境动态表征,如同一个"计算雪球",AI可以在其中评估预测和决策,然后再应用到真实世界任务中。
核心定义¶
-
NVIDIA定义: 世界模型是能够理解真实世界动态的神经网络,包括物理规律和空间属性
-
学术定义: 能够推断和预测真实世界动态的内部模拟器,通过对外部环境建模来支持感知、预测和决策
-
LeCun定义: AI系统内部对世界如何运作的心智模型,支持预测、规划和因果推理
与传统AI模型的关键区别¶
2. 思想起源 (1943-1980s)¶
2.1 Kenneth Craik 的心智模型 (1943)¶
29岁的苏格兰心理学家 Kenneth Craik 发表专著《The Nature of Explanation》,提出生物体在头脑中携带"外部现实的小型模型"(a small-scale model of external reality),用于评估替代方案并做出有能力的反应。
核心洞察: 思维的本质是对外部世界的内部模拟。
2.2 SHRDLU: 早期AI中的世界模型 (1960s末)¶
Terry Winograd 开发的 SHRDLU 系统使用简单的"积木世界"(Block World)来回答常识性问题(如"金字塔能支撑一个方块吗?"),这是AI领域最早的世界模型实践。
局限: 手工制作的模型无法扩展到处理更复杂的现实场景。
2.3 Rodney Brooks 的否定 (1980s末)¶
MIT AI与机器人先驱 Rodney Brooks 放弃了世界模型方向,发表著名论断:
"The world is its own best model."(世界本身就是最好的模型)
他主张机器人应直接与环境交互,而非依赖内部表征。这一观点主导了此后近20年的机器人学。
3. 深度学习时代的复兴 (1990-2018)¶
3.1 Dyna 算法 (1990)¶
Richard S. Sutton 提出 Dyna 架构,这是基于模型的强化学习(MBRL) 的奠基之作:
-
智能体学习一个环境的转移模型
-
使用该模型进行"心理模拟"(mental rehearsal)
-
在想象的经验中进行策略优化
3.2 里程碑论文: "World Models" (2018)¶
David Ha & Jürgen Schmidhuber 发表经典论文 "World Models",提出三组件架构:
flowchart LR
obs["观测<br/>(像素)"]
v["V (VAE)<br/>视觉编码<br/>压缩为 latent z"]
m["M (MDN-RNN)<br/>记忆 + 预测<br/>P(z_{t+1} | z_t, a_t)"]
c["C (Controller)<br/>策略 a = π(z, h)"]
act["动作"]
obs --> v --> m --> c --> act
m -.dream rollout.-> m
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class obs,v,m,c,act stage
关键创新: 智能体可以完全在"梦境"中训练——仅使用世界模型的想象rollout来优化策略,无需与真实环境交互。
4. 大模型时代的爆发 (2019-2024)¶
4.1 Dreamer 系列 (2019-2023)¶
4.2 LLM中的涌现世界表征 (2022-2024)¶
Othello-GPT实验 (Li et al., 2022):
-
仅在棋步序列上训练的GPT模型
-
研究发现网络内部涌现出了棋盘状态的非线性表征
-
后续研究进一步发现存在线性表征 (Neel Nanda)
-
ICLR 2025 论文:7个语言模型在Othello任务上均达到99%准确率
争议: 这是否意味着LLM内部确实存在世界模型?
-
支持者: Hinton, Sutskever, Olah — LLM内部某处必然存在"外部现实的小型模型"
-
反对者: Harvard/MIT研究 — LLM学到的是"启发式规则的集合"(bags of heuristics),并非一致的整体
4.3 Sora的冲击 (2024.02)¶
OpenAI发布Sora,并以论文标题 "Video Generation Models as World Simulators" 明确将视频生成模型定位为世界模拟器,引发行业巨震。
5. 商业化元年 (2025-2026)¶
时间线¶
参考来源¶
↑ 上级 · World Model