跳转至

压缩即智能:LLM 的数学本质是什么?

更新日期:2026-04-16


这个话题为什么是基础中的基础

Scaling Law 不是经验拟合——它有信息论的数学必然性。理解"为什么 loss 呈幂律下降"等于理解"LLM 的训练到底在做什么"。这决定了你对数据质量、模型规模、训练预算的所有决策。


故事线

LLM 的训练在做什么?压缩数据。

Cross-Entropy Loss = 平均每 token 的最优编码长度。降低 loss = 更好的压缩 = 对数据更深的理解。这不是隐喻,是 Shannon 信息论的数学事实。而 loss 为什么呈幂律下降?因为数据中的"知识"分布服从 Zipf 定律——高频知识先学,低频知识越来越难,形成了特定指数的幂律。

详见 A5.1 压缩即智能:信息论推导

给了这么多钱,模型应该多大、数据应该多少?

Chinchilla 说 1:20,但几乎没人遵循。LLaMA-3 8B 用了 15T tokens(Chinchilla 建议 160B)。为什么?因为推理成本远大于训练成本。而 2025 的新发现更激进:小模型 + 大量推理计算可以超过大模型。数据质量比数量更重要——同样 100B tokens,FineWeb-Edu 训出的模型比随机 CC 高 15 个 MMLU 百分点。

详见 A5.2 Scaling Laws 公式与数据质量


上级 · A. 基础理论