跳转至

压缩即智能:信息论视角与 Scaling Laws 推导

更新日期:2026-04-16


三、Scaling Laws 完整公式

3.1 Kaplan (2020) vs Chinchilla (2022)

3.2 Chinchilla 公式详解

Chinchilla 的核心公式:

\(L(N,D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}\)

  • \(E\):不可约误差(数据本身的熵,即使完美模型也无法降到 0)

  • \(A/N^{\alpha}\):模型能力不足的误差(欠拟合项)

  • \(B/D^{\beta}\):数据不足的误差(过拟合/泛化项)

给定计算预算 \(C = 6ND\),最优分配:

\(N_{\text{opt}} \propto C^{\beta/(\alpha+\beta)}, \quad D_{\text{opt}} \propto C^{\alpha/(\alpha+\beta)}\)

\(\alpha \approx \beta\) 时,\(N\)\(D\)相同比例增长。Chinchilla 的 \(\alpha=0.34, \beta=0.28\)\(N:D \approx 1:20\)

3.3 后 Chinchilla 的修正

3.4 Chinchilla 在实际中的使用

概念上广泛使用,实践上几乎没人遵循。 - LLaMA-3 8B 训练了 15T tokens(Chinchilla 建议 ~160B,差 100x)

  • 原因:推理成本远大于训练成本。部署时更小但训练更充分的模型更经济

  • 不同架构/优化器需要重新拟合 — 没有万能的 Chinchilla


四、推理时计算 Scaling (Test-Time Scaling)

4.1 新的 Scaling 维度

传统 scaling 只增大 \(N\)\(D\)。推理时 scaling 增大推理计算量 \(C_{\text{infer}}\)

4.2 关键发现

小模型 + 大量推理计算 > 大模型 + 少量推理计算 例如:GPT-4o-mini + CoT + Best-of-64 可达到 GPT-4 + greedy decoding 的水平——而成本可能更低(小模型每 token 便宜)。

这改变了 scaling 的经济学:

  • 传统:训一个更大的模型 → 所有请求受益,但训练贵

  • :训一个中等模型 + 对困难问题投入更多推理 → 更灵活

DeepSeek-R1 用 37B 激活参数(远小于 GPT-4 估计的 ~220B)但在推理任务上接近甚至超越 GPT-4,靠的就是推理时 scaling(长 CoT)。


五、数据质量与 Loss 曲线

5.1 同样训练 100B tokens,不同质量数据的对比

参考 FineWeb (Penedo et al., 2024)Phi-1 (Gunasekar et al., 2023)

5.2 信息论解释

数据中每 token 的条件信息量决定了 loss 下降速度。 - 高质量数据:信息密度高,每 token 携带更多"知识"→ \(\alpha\)

  • 噪声/重复:不含可学习信息,但消耗 token quota → \(\alpha\)

  • 合成数据:如果质量好可以提高 \(\alpha\),但重复模式会导致 model collapse

5.3 Loss ≠ 下游能力

同样 loss=2.0 的两个模型,能力可能差异巨大。在噪声数据上训到 loss=2.0,模型学到的是噪声;在高质量数据上训到 loss=2.0,模型学到的是真正的知识。Loss 只能在同一数据集内比较。


六、从理论到实践

6.1 用 Scaling Laws 指导训练的流程

  1. 小规模实验:用 100M-1B 模型跑多个 \((N, D)\) 配置(通常 5-10 个点)

  2. 拟合 Scaling Law\(L(N,D) = E + A \cdot N^{-\alpha} + B \cdot D^{-\beta}\)

  3. 外推到目标规模:预测 70B 模型需要多少 \(D\)

  4. 注意:每次换架构/优化器/数据 → 需要重新拟合

小规模 Scaling 拟合的外推在大规模上通常有 5-10% 偏差,但足以指导训练决策。参考 Scaling Laws Revisited (2025)

6.2 实用经验法则


七、追问延伸

问题 方向 详见
合成数据怎么影响 Scaling Law? 好的合成提高有效 \(D\),但 model collapse 风险 B4
多模态的 Scaling Law 是什么样? 图像和文本 scaling 行为不同,联合训练更复杂 F2
能否预测最终 benchmark 分数? 部分可以(loss → ppl → 部分基准),涌现行为难预测 I1
loss plateau 怎么诊断? 数据耗尽/重复、lr 太低、架构瓶颈 C6

参考文献

  • [1] Kaplan et al. Scaling Laws for Neural Language Models. 2020. 论文

  • [2] Hoffmann et al. Training Compute-Optimal LLMs (Chinchilla). 2022. 论文

  • [3] Pu et al. Understanding LLM Behaviors via Compression. 2025. 论文

  • [4] Compression Laws for Large Language Models. 2025. 论文

  • [5] Penedo et al. FineWeb. 2024. 论文

  • [6] Gunasekar et al. Textbooks Are All You Need (Phi-1). 2023. 论文

  • [7] Muennighoff et al. Scaling Laws Revisited. ACL 2025. 论文

  • [8] Wolfe. Scaling Laws for LLMs: GPT-3 to o3. 博客


上级 · A5. 压缩即智能:信息论视角与 Scaling Laws 推导