世界模型 = 内在科学家?¶
最后更新: 2026-04-17 | 整个调研的哲学顶层
核心论点:真正的世界模型应该是一个内在科学家——能主动实验、发现规律、制造工具,而不是视频生成器。
引言¶
当前世界模型领域存在根本认知错位:工业界定义为"生成物理一致视频",但真正的世界模型应能主动设计实验、从数据中提炼规律、制造工具改造环境。
三根认知科学支柱:
-
Craik (1943): 心智模型强调主动推理,非被动复现
-
Piaget: 认知源于主动操纵,非被动观察
-
Homo faber: 人类核心优势 = 工具制造 = 物理规律内化
一、认知科学:工具制造需要什么认知能力?¶
Homo faber 与技术推理¶
Osiurak & Reynaud (2019, Psychological Review) 三层理论:
-
L1 习惯性工具使用:条件反射(黑猩猩可以)
-
L2 推论性工具使用:因果推理(乌鸦可以)
-
L3 创造性工具制造:反事实推理+心理模拟(人类独有)
工具制造瓶颈不是感知/运动,是反事实物理推理:"如果磨尖石头边缘,会产生什么切割效果?"
Isler等 (2022, PNAS): 儿童3岁开始工具制造,与心理模拟能力相关 r=0.64(高于一般智力 r=0.31)。
婴儿是物理学家¶
-
Spelke 核心知识:4.5个月已有物体永久性、基本力学直觉
-
Piaget 循环反应:婴儿通过扔/推/拉学习物理
-
Stahl & Feigenson (2015, Science): 物体违反物理→婴儿不仅惊奇,还主动把玩来"修复"预测误差
当前所有WM的训练数据来自被动视频 = 让AI婴儿只能看不能动。这从认知科学角度几乎确定不充分。
心理模拟¶
-
Craik (1943): 原始定义就是行动导向,非感知导向
-
Shepard & Metzler (1971, Science): 心理旋转时间与角度线性相关 r=0.994
-
预测编码 (Friston): 预测误差驱动主动探索(active inference)
二、科学发现 AI¶
符号回归¶
-
AI Feynman (Tegmark 2020, Science Advances): 100/100 Feynman方程
-
PySR (Cranmer NeurIPS 2020): 天体物理暗能量关系发现
-
LLM-SR (ICLR 2025): Nguyen-12成功率78% vs PySR 61% vs AI Feynman 72%; 样本效率3×提升
-
SciNet (PRL 2020): 从地心说数据自发发现日心说坐标!
-
AI Descartes (Nature Comms 2023): 物理约束搜索,数据需求减少30-50%
符号回归 × 世界模型的结合(空白地带)¶
-
Neural-Symbolic World Models (NeurIPS 2023): 潜空间→符号规则→规划,性能仅降4%
-
DISCOVER (ICML 2021): 机器人主动交互发现物理规律
-
端到端整合仍是重要空白
AlphaFold / GNoME: 算"世界模型"吗?¶
-
AlphaFold 2: CASP14 GDT 92.4, 但依赖共进化信息(MSA),orphan proteins精度大降
-
GNoME: 220万新材料(45×历史),但只能说"稳定"不能说"为什么"
-
判断:专用域统计物理近似,非物理第一原理推理
自主实验AI¶
-
Autonomous Chemical Research (Boiko 2023, Nature): GPT-4+机器人台,自主合成阿司匹林!
-
FunSearch (DeepMind Nature 2024): LLM发现数学函数,帽集问题打破数十年记录
-
AI Scientist (Sakana AI 2024): 全流程科学论文 $15/篇
-
ALEM: 钙钛矿太阳能电池效率从16.2%→18.1%(超人类手动优化)
三、主动探索:世界模型的缺失维度¶
好奇心驱动RL¶
-
ICM (Pathak 2017 ICML): VizDoom纯好奇心探索54% vs 随机28%
-
RND (Burda 2019 ICLR): Montezuma's Revenge 10K+ (vs DQN 2.5K)
-
Go-Explore (Ecoffet 2021, Nature): Montezuma 400K+ (超人类50K记录)
Plan2Explore: 在想象中做实验¶
Sekar 2020 NeurIPS: 世界模型(RSSM) + 集成预测器分歧度作为内在奖励
-
零奖励纯探索后,仅 1000 步真实交互即可适应下游任务
-
样本效率比 Dreamer 提升 2.5×
-
在想象中做实验比真实便宜无数倍!
DreamerV3 的探索¶
-
KL散度作为内在奖励
-
Crafter 无探索奖励解锁 17/22 成就 (vs PPO 10个)
主动因果发现¶
-
ACTA (ICLR 2024): 世界模型内主动设计干预序列,因果图恢复87% vs 被动51%
-
机器人主动推物体推断质量:比视觉估计精确4-6×
四、工具使用与工具制造¶
数字工具调用¶
-
Toolformer (NeurIPS 2023): 6.7B超越66B GPT-3
-
ART (EMNLP 2023): BIG-Bench +14%
-
Gorilla: API调用准确率84%
物理工具推理 vs 数字工具调用¶
-
数字:有限/离散/已知 → 物理:无限/连续/需发明
-
数字:函数返回值 → 物理:需做实验
-
关键差异:物理工具需要制造不存在的结构
AI能发明工具吗?¶
-
LIMEC (2023): 用积木/绳子组合工具触发高处按钮,15种组合成功率53%(极原始)
-
DreamCoder (PLDI 2021): 自动发现"质心""角动量"的可复用程序库
-
真正的工具发明(理解功能→选材料→构建新结构):几乎空白
五、ARC Challenge: 智能的真正考验¶
Chollet 的智能定义¶
Intelligence = 技能获取效率 / 泛化难度
= 从少样本中发现规律并外推的能力
ARC 分数 (截至 2026)¶
-
人类: ~85% (ARC-AGI-1) / ~80% (ARC-AGI-2)
-
o3 高算力: 87.5% (ARC-AGI-1) → 4% (ARC-AGI-2!)
-
MindsAI TTT+程序合成: 55.5% (获$500K奖金)
-
GPT-4o: 5% / Claude 3.5: ~21%
o3 在 ARC-AGI-2 从 87.5% 暴跌至 4%,证明不是真正归纳。
ARC 与物理规律发现是同构的¶
-
ARC: 看3-5个输入输出 → 归纳变换规则 → 应用于新输入
-
物理: 做3-5次实验 → 提炼定律 → 预测新情况
-
能解ARC的系统应该也能发现物理规律
六、LeCun 蓝图与主动实验¶
Cost Module 支持主动实验¶
感知→短期记忆→世界模型(JEPA)→动作提议→代价模块(好奇心+任务)→动作优化
"不满足感"驱动 = 好奇心驱动主动探索(原则上支持,实践未实现)
JEPA 能做主动实验吗?¶
当前 I-JEPA / V-JEPA: 纯被动预测,无动作条件化
走向主动路线图:
-
V-JEPA + 动作条件化
-
Plan2Explore 的 JEPA 版
-
集成好奇心内在代价
Value-guided JEPA (2025.01) 是第一步。探索组件仍空白。
七、"内在科学家"能力记分卡¶
当前最佳世界模型在10项能力上的得分:
-
被动物理预测: 7/10 (Genie 3, Sora 2)
-
因果理解: 3/10 (Dreamer V3)
-
主动实验设计: 2/10 (Plan2Explore)
-
规律抽象(符号): 4/10 (AI Feynman, LLM-SR)
-
少样本归纳: 3/10 (o3 ARC, 靠算力非归纳)
-
工具使用(已知): 6/10 (SayCan, ChemCrow)
-
工具制造(新): 1/10 (LIMEC)
-
假说生成: 5/10 (AI Scientist, FunSearch)
-
实验执行(物理): 2/10 (Autonomous Lab)
-
结果解读更新: 3/10 (ACTA)
综合: 约 3.5/10
得分最高的"被动物理预测"不是内在科学家的核心能力。
八、研究路线图¶
阶段一: 物理一致被动预测 ✓ (部分实现)
阶段二: 动作条件化世界模型 ✓ (已实现, Dreamer)
阶段三: 主动探索+好奇心 (~30%, Plan2Explore原型)
阶段四: 规律发现+符号抽象 (~20%, LLM-SR/FunSearch)
阶段五: 工具制造 (<5%, 几乎空白)
阶段六: 内在科学家 (目标, 2030+?)
五个核心开放问题¶
-
如何形式化"观察→假说"的跳跃?(溯因推理)
-
主动实验信号的设计(优于ICM/RND的形式化?)
-
符号规律与神经WM的双向通道
-
工具发明的组合创造力
-
评估标准缺失(没有基准评测"内在科学家"能力)
核心结论¶
-
当前WM是被动学习者,非主动实验者(科学家只能读文献不能做实验)
-
规律发现AI与世界模型几乎没有交叉(最重要的空白)
-
ARC-AGI-2 让 o3 从87.5%→4%(不是真正归纳)
-
Plan2Explore是最接近原型,但限于简单环境
-
工具制造是最远的目标,需所有能力整合
没有任何系统同时具备:主动实验+物理理解+规律抽象+工具制造。
参考¶
核心结论¶
-
当前WM是被动学习者,非主动实验者
-
规律发现AI与世界模型几乎没有交叉(最重要空白)
-
ARC-AGI-2 让 o3 从87.5%→4%(不是真正归纳)
-
Plan2Explore是最接近原型,但限于简单环境
-
工具制造是最远目标,需所有能力整合
没有任何系统同时具备:主动实验 + 物理理解 + 规律抽象 + 工具制造。
参考¶
-
Craik (1943) The Nature of Explanation
-
Stahl & Feigenson (2015, Science) — 婴儿物理违反→主动探索
-
AI Feynman (Science Advances 2020) — 100/100物理方程
-
LLM-SR (ICLR 2025) — 78% vs PySR 61%
-
FunSearch (Nature 2024) — 帽集问题数十年记录
-
Autonomous Chemistry (Nature 2023) — 自主合成阿司匹林
-
Plan2Explore (NeurIPS 2020) — 想象中主动探索
-
ACTA (ICLR 2024) — 主动因果发现87%
-
Chollet: On the Measure of Intelligence (2019)
-
ARC-AGI Prize (2024) — MindsAI 55.5%获$500K
-
LeCun: A Path Towards AMI (2022)
↑ 上级 · 00 世界模型的"皇帝新衣":视频生成 ≠ 物理理解