跳转至

世界模型的数学基础

最后更新: 2026-04-16 | 公式推导级

ELBO 完整推导

从 Jensen 不等式出发

  • 目标: 最大化边际对数似然 log p(x)

  • 引入变分分布 q(z|x), Jensen 不等式得下界:

  • ELBO = E_q[log p(x|z)] - KL(q(z|x) || p(z))

  • 间隙 = KL(q(z|x) || p(z|x)) >= 0

  • 当推断网络精确匹配真实后验时 ELBO 紧

KL(q||p) vs KL(p||q)

反向 KL = 零强制 (Zero-Forcing)

  • p(x)≈0 处 q(x)>0 → log(q/p) 爆炸

  • 优化器强制 q 集中在 p 有支撑的地方

  • 结果: q 选择 p 的一个众数, 忽略其他

正向 KL = 零避免 (Zero-Avoiding)

  • p(x)>0 处 q(x)≈0 → log(p/q) 爆炸

  • 优化器强制 q 覆盖 p 的所有众数

  • 结果: q 铺开覆盖, 但拟合不精确

直觉图示

  • 双峰分布 p: 峰A + 峰B

  • 最小化 KL(q||p): q 只选峰A, 忽略峰B

  • 最小化 KL(p||q): q 铺开覆盖两峰(过度分散)

VAE 后果

  • VAE 用 KL(q||p) → 后验坍塌: 解码器太强时 q ≈ p(z)

Score Matching → DSM 等价性

Hyvärinen SM (2005)

  • 学习 score function: s(x) ≈ ∇_x log p(x)

  • 原始 SM 需要 Hessian, 计算昂贵

Vincent DSM 等价性 (2011)

  • 对噪声核 q_σ(x̃|x) = N(x̃; x, σ²I):

  • DSM 目标 = SM 目标 (作用于噪声分布)

  • ∇log q_σ(x̃|x) = -(x̃-x)/σ² (解析 score)

  • 无需 Hessian, 只需预测去噪方向

  • DDPM 的 ε-prediction 正是 DSM 的实用化


Flow Matching 的 OT 视角

连续流基础

  • 学习向量场 v(x,t), ODE: dx/dt = v(x,t)

  • x_0 ~ 噪声, x_1 ~ 数据

条件流匹配 (Lipman ICLR 2023)

  • 无需模拟 (simulation-free): 回归条件向量场

  • 对高斯条件路径: u_t = μ̇(z) + σ̇/σ·(x-μ)

OT-CFM: Wasserstein-2 最优传输

  • 最优耦合: π* = argmin E[||x_0-x_1||²]

  • 直线路径: x_t = (1-t)x_0 + tx_1, 目标速度 v* = x_1-x_0 (常数!)

  • 最小化动能 ∫E||v_t||²dt (Benamou-Brenier)

  • 推断只需极少 ODE 步 (10-50 vs DDPM 1000)


信息瓶颈与 VAE/JEPA 对应

Tishby IB (2000)

  • min I(X;Z) - β·I(Z;Y)

  • 压缩 X → Z, 同时保留关于 Y 的信息

IB → VAE

  • 重建目标: I(Z;Y) → E[log p(x|z)]

  • 正则项: β·I(X;Z) → β·KL(q||p)

  • β-VAE 是 IB 的无监督版

IB → JEPA

  • JEPA 在表示空间预测, 不重建像素

  • 隐式执行 IB: 压缩 context → Z, 保留目标相关信息

  • 不需要显式 KL 正则, 通过 EMA + stop-gradient 防崩溃


率失真理论与 Tokenizer 设计

Shannon R(D)

  • R(D) = min I(X;X̂) s.t. E[d(X,X̂)] ≤ D

  • 高斯源: R(D) = ½ log(σ²/D)

与 Tokenizer 的联系

  • 词表大小 |V| 对应码率 R

  • 重建质量 (perplexity) 对应失真 D

  • 大词表 BPE: 率↑→失真↓ (符合 R-D 理论)

  • 率失真感知三角形: R ↔ D ↔ P (感知质量)


MPPI: Feynman-Kac 路径积分推导

问题

  • 系统: dx = f(x)dt + B(u dt + Σ^{½} dW)

  • 目标: min E[φ(x_T) + ∫C(x,u)dt]

五步推导

  1. 随机 HJB PDE → 最优 u* = -λ B^T ∇V

  2. 指数变换 V = -λ log Ψ → 线性 PDE

  3. Feynman-Kac: Ψ = E_Q[exp(-∫q/λ ds)]

  4. 最优控制的重要性采样表示

  5. 蒙特卡洛近似: u* ≈ Σ (w_k/Σw_j) ε_k, w_k = exp(-S(τ_k)/λ)

直觉

  • 低代价轨迹获高权重 = 路径空间中的重要性采样

  • 温度 λ→0 贪心, λ→∞ 均匀

  • GPU 并行 K=1000-10000 样本, ~10ms/step

参考


上级 · 02 技术架构与核心方法