跳转至

优化器:Adam → Muon → Scheduler → Per-Layer LR → 调参理论

更新日期:2026-04-16


五、Per-Layer LR:为什么不同层需要不同学习率

5.1 核心问题:层的语义差异

Transformer 不同层编码不同级别的信息:底层 ≈ 语法/词法(通用、可迁移),顶层 ≈ 任务特定语义(需要适应)。参考 Clark et al., 2019Jawahar et al., 2019

5.2 BERT 的实证发现

NVIDIA 的实验 (Pretraining BERT with LLRD):

用 Layer-wise Learning Rate Decay (LLRD) 预训练 BERT,底层 lr ≈ \(10^{-6}\),顶层 ≈ \(3.5 \times 10^{-6}\),decay rate = 0.9。 结果:LLRD 一致性地提升了下游微调性能,尤其是小数据集微调时收益最大(因为底层知识更珍贵)。

5.3 预训练 vs 微调的 Per-Layer LR 策略

对于预训练,Per-layer lr 不是标准做法。但 2025 年的研究 (How to Set LR for Large-Scale Pre-training, 2025) 开始探索预训练中的 per-layer 策略,发现在某些架构(如 MoE)中有收益。

5.4 LLRD 公式

\(\text{lr}(\text{layer}_i) = \text{base\_lr} \times d^{L-1-i}\)

\(d = 0.8\text{-}0.95\) 是衰减率,\(L\) 是总层数,\(i\) 是层号。

典型效果(32 层, \(d=0.8\)):

  • 顶层 (31): \(\text{base\_lr}\)

  • 中间 (15): \(\text{base\_lr} \times 0.8^{16} \approx 0.028 \times \text{base\_lr}\)

  • 底层 (0): \(\text{base\_lr} \times 0.8^{31} \approx 0.001 \times \text{base\_lr}\)

底层 lr 只有顶层的 0.1%——几乎冻结。

5.5 Layer-wise 进化搜索

Layer-Wise LR Optimization (ACM TELO, 2024) 用进化算法为每层独立搜索最优 lr,不假设 exponential decay 形式。

发现:最优 per-layer lr 分布不是单调递增的——某些中间层需要比周围层更高的 lr(可能因为它们是"语义瓶颈")。


七、μP:为什么能从小模型迁移超参

为什么 128M 模型的最优 lr 不能直接用于 70B?因为模型宽度增大时,每层的梯度统计变化。μP (Yang et al., 2022) 找到了一组宽度不变量:通过按宽度缩放 lr 和初始化,使得最优超参在不同宽度间保持不变。 核心:hidden 层和 output head 的 lr 与宽度 \(d\) 成反比:\(\eta_{\text{target}} = \eta_{\text{base}} \times \frac{d_{\text{base}}}{d_{\text{target}}}\)


八、Parabolic Fitting:为什么 loss-lr 是抛物线

在 LR sweep 实验中,把 \(\log(\text{lr})\) 当横轴、最终 loss 当纵轴,3-5 个点就能拟合出一条平滑抛物线。这个性质在小规模实验上验证后,可以外推到大规模——只需 3-5 次 small-N 训练就能预测最优 lr,而不必扫描几十次。

\(\log(\text{lr})\) vs loss 空间中,拟合 \(a(\log\text{lr})^2 + b(\log\text{lr}) + c\),最优:

\(\log(\text{lr}^*) = -b/(2a)\)

为什么是抛物线? 二阶泰勒展开。Loss 关于 lr 在最优点附近可展开为 \(L(\eta) \approx L^* + \frac{1}{2}H(\eta-\eta^*)^2\)。在 log 空间中形状类似抛物线(当 lr 跨越 2-3 个数量级时近似成立)。


九、LR Schedule 与 Curriculum Learning 的冲突

2025 最新发现 (How LR Decay Wastes Your Best Data, 2025):课程学习(先简单后困难的数据顺序)和 cosine decay 相互矛盾。 课程学习把最好的数据放在最后(annealing),但 cosine decay 在最后 lr 最低 → 模型在最好的数据上学习最慢。 解决方案:


十、追问与深入方向

问题 追问 深入方向
为什么 \(\beta_2=0.95\) 不是 0.999? 0.999 对应 ~1000 步记忆窗口,但 LLM 训练中数据 domain 频繁切换(代码→网页→数学),旧统计 \(v\) 需要快速"忘记" 测试 0.9/0.95/0.99/0.999 的 loss 曲线差异
Warmup 到底需要多少步? 经验 1-2K,但理论上需要 \(\sim 1/(1-\beta_2)\) 步让 \(v\) 有意义 关注 LionAR 等不需要 warmup 的优化器
WSD 的 decay 要多长? ~10% 总步数。过短→不够收敛,过长→浪费 stable 的探索时间 自适应 decay length 是开放问题
为什么 embedding 不用 Muon? Embedding 是 lookup table,不是矩阵乘法,正交化无意义 探索 embedding-specific 优化器
Cosine 还是 WSD? 如果你能预设总步数 → cosine 安全;否则 → WSD 必选 WSD-S, WSM 是新前沿
lr decay 到 0 还是 min_lr? 最新研究说 D2Z(衰减到精确 0)最优 但如果要 continual training,不能到 0


参考文献

  • [1] NVIDIA. Pretraining BERT with LLRD. 博客

  • [2] Layer-Wise LR Optimization (Evolutionary). ACM TELO 2024. 论文

  • [3] How to Set LR for Large-Scale Pre-training. 2025. 论文

  • [4] Yang et al. μP. ICLR 2022. 论文


上级 · D1. 优化器:Adam → Muon → 调参理论(Parabolic Fitting、μP)