D. 预训练 Recipe¶
把 A、B、C 章拼成一个能落地的 recipe:优化器选型(Adam → Muon → 调参理论 μP / Parabolic Fitting)、混合精度(BF16 → FP8 哪些层能量化)、Dense / MoE 模型的完整训练 recipe,以及给定规模的成本估算(多少卡、多长时间、多少钱)。
章节¶
- D1. 优化器:Adam → Muon → 调参理论
- D2. 混合精度训练:BF16 → FP8,哪些层能量化
- D3. Dense 模型预训练完整 Recipe
- D4. MoE 模型预训练完整 Recipe
- D5. 成本估算:给定规模需要多少卡、多少时间、多少钱
↑ 上级 · 大语言模型/多模态大模型 LLM/MLLM