跳转至

LLM 内部世界模型之争

最后更新: 2026-04-16 | 深度调研

Othello-GPT 完整实验链条

起点: Kenneth Li et al. (2022) — 非线性探针

论文: arXiv:2210.13382 (ICLR 2023 Oral)

  • 训练 8 层 GPT 预测 Othello 合法落子序列, 从未告知棋盘状态

  • 探针: 双层 ReLU MLP (非线性), 作用于 Layer 7 残差流

  • 结果: 非线性探针 ~98% 准确率; 线性探针仅 20.4%

  • 干预实验: 修改内部激活 → 模型在新棋盘状态下输出合法落子

  • Li 的结论: 模型学会了涌现世界表示, 但是非线性压缩的

转折: Neel Nanda et al. (2023) — 线性探针突破

论文: arXiv:2309.00941 (BlackboxNLP @ EMNLP 2023)

关键洞察: Li 用 {黑,白,空} 分类; Nanda 发现模型用 {我方,对方,空} — 奇偶步符号翻转导致线性探针假失败

  • 线性探针 Layer 6: ~99.5% 准确率 (vs Li 的 20.4%)

  • Layer 4 探针零样本迁移到 Layer 6: 说明棋盘状态 Layer 4 已完整编码

  • 干预: 对 Layer 4 残差流探针方向取反 × 缩放(0-16) → 模型在任意(甚至非法)棋盘态输出合法落子

Nanda vs Li 学术争论:

  • Li: 非线性探针才是 ground truth

  • Nanda: 线性探针 + 因果干预 = "真正的内部表示"标准

  • 核心分歧: 探针表达能力 ≠ 表示真实结构

反驳: MATS 6.0 "启发式规则包" (2024)

来源: LessWrong, 作者 jylin04 (Nanda MATS 6.0 暑期学员)

  • 精细神经元级逆向工程

  • 发现: OthelloGPT 通过许多独立局部决策规则计算, 而非全局一致的世界模型

  • 例: MLP Neuron L1N421 编码 "若 A4 落子 AND B4 有棋 → 更新 B4+C4+D4"

  • 规则不能泛化到棋盘平移 (位置特异)

  • 结论: "一包独立启发式规则" (bag of heuristics), 非统一世界模型

深化: ICLR 2025 七模型实验

论文: arXiv:2503.04421

  • 7 个模型: GPT-2 / T5 / BART / Flan-T5 / Mistral / LLaMA-2 / Qwen2.5

  • 无监督 grounding 准确率 up to 99%

  • 跨模型表征高度相似 (不同架构收敛到相同表示结构)

  • 为 Othello 世界模型假说提供"迄今最强"证据


Manhattan 导航实验

论文: arXiv:2505.20874 (2025.05)

实验设置

  • 100×100 网格模拟曼哈顿城市布局

  • POI 数量: 1024, 随机分布

空间感知探针 (绝对坐标预测)

  • X 坐标 MAE: 0.78 km, R² = 1.00

  • Y 坐标 MAE: 0.71 km, R² = 1.00

  • 欧氏距离误差: 1.18 km

R² ≈ 1.00 意味着 LLM 隐状态的线性投影几乎完美预测全局坐标!

道路扰动实验 (3 类)

  • Road Perturbation: 首步准确率暴跌至 11.85% (高度敏感)

  • Distance Perturbation: 首步 58.79% (有一定鲁棒性)

  • Direction Perturbation: 目的地偏差最大 56.08 km (方向是核心)

结论: LLM 从局部描述构建全局一致的空间认知地图


Gurnee & Tegmark: 空间/时间神经元 (ICLR 2024)

论文: arXiv:2310.02207

  • 模型: Llama-2 系列 (7B/13B/70B)

  • 6 个数据集: 全球地点/美国地点/NYC + 历史人物/艺术品/新闻

  • 发现: LLM 学会了空间和时间的线性表示

  • 不同实体类型间统一 (城市和地标共享同一空间方向)

  • 发现"空间神经元"和"时间神经元"

  • 对 prompt 形式变化保持稳健


Melanie Mitchell 的批判 (2025.02)

来源: AI Guide Substack, LLMs and World Models Part 1 & 2

世界模型光谱 (引 Jacob Andreas)

静态查找表 → 地图 → 太阳系仪 → 模拟器

Part 1 核心

  • Sutskever (支持): LLM 学到"世界的压缩抽象表示"

  • LeCun (反对): LLM 本质是"近似检索"

  • 历史反例: 皮肤病变分类器学到"标尺=恶性"

Part 2 核心 (针对 OthelloGPT)

  • 看到 Nanda 线性探针后"相当震惊"

  • 但 MATS 6.0 发现让她重新谨慎

  • 最终类比: "托勒密本轮模型" — 有限范围内有效, 但非真正理解底层规律


当前共识与分歧

支持方证据

  • Othello-GPT: 7 个模型 99% grounding, 跨架构收敛

  • Manhattan: R²=1.00 空间坐标探针

  • Gurnee/Tegmark: 空间/时间神经元跨数据集稳健

  • ICLR 2024: 线性表示在不同 prompt 下持久

反对方证据

  • MATS 6.0: 局部规则集合, 非全局模型

  • Manhattan 扰动: 道路扰动首步准确率仅 11.85%

  • "Stochastic Parrot" (arXiv:2502.08946): SOTA LLM 物理概念落后人类 40%

方法论共识

  • 非线性探针成功 ≠ 世界模型

  • 只有"线性探针成功 + 因果干预成功"才是较强证据

  • 简单任务 (Othello) 的涌现不能直接外推到真实世界物理理解

参考


上级 · 07 评估基准与指标体系