跳转至

世界模型 = 内在科学家?

最后更新: 2026-04-17 | 整个调研的哲学顶层

核心论点:真正的世界模型应该是一个内在科学家——能主动实验、发现规律、制造工具,而不是视频生成器。


引言

当前世界模型领域存在根本认知错位:工业界定义为"生成物理一致视频",但真正的世界模型应能主动设计实验、从数据中提炼规律、制造工具改造环境。

三根认知科学支柱:

  1. Craik (1943): 心智模型强调主动推理,非被动复现

  2. Piaget: 认知源于主动操纵,非被动观察

  3. Homo faber: 人类核心优势 = 工具制造 = 物理规律内化


一、认知科学:工具制造需要什么认知能力?

Homo faber 与技术推理

Osiurak & Reynaud (2019, Psychological Review) 三层理论:

  • L1 习惯性工具使用:条件反射(黑猩猩可以)

  • L2 推论性工具使用:因果推理(乌鸦可以)

  • L3 创造性工具制造:反事实推理+心理模拟(人类独有)

工具制造瓶颈不是感知/运动,是反事实物理推理:"如果磨尖石头边缘,会产生什么切割效果?"

Isler等 (2022, PNAS): 儿童3岁开始工具制造,与心理模拟能力相关 r=0.64(高于一般智力 r=0.31)。

婴儿是物理学家

  • Spelke 核心知识:4.5个月已有物体永久性、基本力学直觉

  • Piaget 循环反应:婴儿通过扔/推/拉学习物理

  • Stahl & Feigenson (2015, Science): 物体违反物理→婴儿不仅惊奇,还主动把玩来"修复"预测误差

当前所有WM的训练数据来自被动视频 = 让AI婴儿只能看不能动。这从认知科学角度几乎确定不充分。

心理模拟

  • Craik (1943): 原始定义就是行动导向,非感知导向

  • Shepard & Metzler (1971, Science): 心理旋转时间与角度线性相关 r=0.994

  • 预测编码 (Friston): 预测误差驱动主动探索(active inference)


二、科学发现 AI

符号回归

  • AI Feynman (Tegmark 2020, Science Advances): 100/100 Feynman方程

  • PySR (Cranmer NeurIPS 2020): 天体物理暗能量关系发现

  • LLM-SR (ICLR 2025): Nguyen-12成功率78% vs PySR 61% vs AI Feynman 72%; 样本效率3×提升

  • SciNet (PRL 2020): 从地心说数据自发发现日心说坐标!

  • AI Descartes (Nature Comms 2023): 物理约束搜索,数据需求减少30-50%

符号回归 × 世界模型的结合(空白地带)

  • Neural-Symbolic World Models (NeurIPS 2023): 潜空间→符号规则→规划,性能仅降4%

  • DISCOVER (ICML 2021): 机器人主动交互发现物理规律

  • 端到端整合仍是重要空白

AlphaFold / GNoME: 算"世界模型"吗?

  • AlphaFold 2: CASP14 GDT 92.4, 但依赖共进化信息(MSA),orphan proteins精度大降

  • GNoME: 220万新材料(45×历史),但只能说"稳定"不能说"为什么"

  • 判断:专用域统计物理近似,非物理第一原理推理

自主实验AI

  • Autonomous Chemical Research (Boiko 2023, Nature): GPT-4+机器人台,自主合成阿司匹林!

  • FunSearch (DeepMind Nature 2024): LLM发现数学函数,帽集问题打破数十年记录

  • AI Scientist (Sakana AI 2024): 全流程科学论文 $15/篇

  • ALEM: 钙钛矿太阳能电池效率从16.2%→18.1%(超人类手动优化)


三、主动探索:世界模型的缺失维度

好奇心驱动RL

  • ICM (Pathak 2017 ICML): VizDoom纯好奇心探索54% vs 随机28%

  • RND (Burda 2019 ICLR): Montezuma's Revenge 10K+ (vs DQN 2.5K)

  • Go-Explore (Ecoffet 2021, Nature): Montezuma 400K+ (超人类50K记录)

Plan2Explore: 在想象中做实验

Sekar 2020 NeurIPS: 世界模型(RSSM) + 集成预测器分歧度作为内在奖励

  • 零奖励纯探索后,仅 1000 步真实交互即可适应下游任务

  • 样本效率比 Dreamer 提升 2.5×

  • 在想象中做实验比真实便宜无数倍!

DreamerV3 的探索

  • KL散度作为内在奖励

  • Crafter 无探索奖励解锁 17/22 成就 (vs PPO 10个)

主动因果发现

  • ACTA (ICLR 2024): 世界模型内主动设计干预序列,因果图恢复87% vs 被动51%

  • 机器人主动推物体推断质量:比视觉估计精确4-6×


四、工具使用与工具制造

数字工具调用

  • Toolformer (NeurIPS 2023): 6.7B超越66B GPT-3

  • ART (EMNLP 2023): BIG-Bench +14%

  • Gorilla: API调用准确率84%

物理工具推理 vs 数字工具调用

  • 数字:有限/离散/已知 → 物理:无限/连续/需发明

  • 数字:函数返回值 → 物理:需做实验

  • 关键差异:物理工具需要制造不存在的结构

AI能发明工具吗?

  • LIMEC (2023): 用积木/绳子组合工具触发高处按钮,15种组合成功率53%(极原始)

  • DreamCoder (PLDI 2021): 自动发现"质心""角动量"的可复用程序库

  • 真正的工具发明(理解功能→选材料→构建新结构):几乎空白


五、ARC Challenge: 智能的真正考验

Chollet 的智能定义

Intelligence = 技能获取效率 / 泛化难度

= 从少样本中发现规律并外推的能力

ARC 分数 (截至 2026)

  • 人类: ~85% (ARC-AGI-1) / ~80% (ARC-AGI-2)

  • o3 高算力: 87.5% (ARC-AGI-1) → 4% (ARC-AGI-2!)

  • MindsAI TTT+程序合成: 55.5% (获$500K奖金)

  • GPT-4o: 5% / Claude 3.5: ~21%

o3 在 ARC-AGI-2 从 87.5% 暴跌至 4%,证明不是真正归纳。

ARC 与物理规律发现是同构的

  • ARC: 看3-5个输入输出 → 归纳变换规则 → 应用于新输入

  • 物理: 做3-5次实验 → 提炼定律 → 预测新情况

  • 能解ARC的系统应该也能发现物理规律


六、LeCun 蓝图与主动实验

Cost Module 支持主动实验

感知→短期记忆→世界模型(JEPA)→动作提议→代价模块(好奇心+任务)→动作优化

"不满足感"驱动 = 好奇心驱动主动探索(原则上支持,实践未实现)

JEPA 能做主动实验吗?

当前 I-JEPA / V-JEPA: 纯被动预测,无动作条件化

走向主动路线图:

  1. V-JEPA + 动作条件化

  2. Plan2Explore 的 JEPA 版

  3. 集成好奇心内在代价

Value-guided JEPA (2025.01) 是第一步。探索组件仍空白。


七、"内在科学家"能力记分卡

当前最佳世界模型在10项能力上的得分:

  • 被动物理预测: 7/10 (Genie 3, Sora 2)

  • 因果理解: 3/10 (Dreamer V3)

  • 主动实验设计: 2/10 (Plan2Explore)

  • 规律抽象(符号): 4/10 (AI Feynman, LLM-SR)

  • 少样本归纳: 3/10 (o3 ARC, 靠算力非归纳)

  • 工具使用(已知): 6/10 (SayCan, ChemCrow)

  • 工具制造(新): 1/10 (LIMEC)

  • 假说生成: 5/10 (AI Scientist, FunSearch)

  • 实验执行(物理): 2/10 (Autonomous Lab)

  • 结果解读更新: 3/10 (ACTA)

综合: 约 3.5/10

得分最高的"被动物理预测"不是内在科学家的核心能力。


八、研究路线图

阶段一: 物理一致被动预测 ✓ (部分实现)

阶段二: 动作条件化世界模型 ✓ (已实现, Dreamer)

阶段三: 主动探索+好奇心 (~30%, Plan2Explore原型)

阶段四: 规律发现+符号抽象 (~20%, LLM-SR/FunSearch)

阶段五: 工具制造 (<5%, 几乎空白)

阶段六: 内在科学家 (目标, 2030+?)

五个核心开放问题

  1. 如何形式化"观察→假说"的跳跃?(溯因推理)

  2. 主动实验信号的设计(优于ICM/RND的形式化?)

  3. 符号规律与神经WM的双向通道

  4. 工具发明的组合创造力

  5. 评估标准缺失(没有基准评测"内在科学家"能力)


核心结论

  1. 当前WM是被动学习者,非主动实验者(科学家只能读文献不能做实验)

  2. 规律发现AI与世界模型几乎没有交叉(最重要的空白)

  3. ARC-AGI-2 让 o3 从87.5%→4%(不是真正归纳)

  4. Plan2Explore是最接近原型,但限于简单环境

  5. 工具制造是最远的目标,需所有能力整合

没有任何系统同时具备:主动实验+物理理解+规律抽象+工具制造。

参考

核心结论

  1. 当前WM是被动学习者,非主动实验者

  2. 规律发现AI与世界模型几乎没有交叉(最重要空白)

  3. ARC-AGI-2 让 o3 从87.5%→4%(不是真正归纳)

  4. Plan2Explore是最接近原型,但限于简单环境

  5. 工具制造是最远目标,需所有能力整合

没有任何系统同时具备:主动实验 + 物理理解 + 规律抽象 + 工具制造。

参考

  • Craik (1943) The Nature of Explanation

  • Stahl & Feigenson (2015, Science) — 婴儿物理违反→主动探索

  • AI Feynman (Science Advances 2020) — 100/100物理方程

  • LLM-SR (ICLR 2025) — 78% vs PySR 61%

  • FunSearch (Nature 2024) — 帽集问题数十年记录

  • Autonomous Chemistry (Nature 2023) — 自主合成阿司匹林

  • Plan2Explore (NeurIPS 2020) — 想象中主动探索

  • ACTA (ICLR 2024) — 主动因果发现87%

  • Chollet: On the Measure of Intelligence (2019)

  • ARC-AGI Prize (2024) — MindsAI 55.5%获$500K

  • LeCun: A Path Towards AMI (2022)


上级 · 00 世界模型的"皇帝新衣":视频生成 ≠ 物理理解