A. 基础理论¶
主流 LLM 的"骨架"层:Transformer 架构、注意力变体、MoE、位置编码、归一化、激活函数、SSM 替代方案,以及 Scaling Laws 的信息论基础。Decoder-only Transformer + GQA + RMSNorm Pre-Norm + RoPE + SwiGLU + BPE(vocab ≥ 100K)—— 2024 年之后几乎所有 Dense 模型都收敛到这个配方,本章拆开每一块讲为什么。
章节¶
- A1. Transformer 架构:从 Attention 到完整前向传播
- A2 注意力机制全景
- A3. MoE 架构:路由、负载均衡、训练稳定性
- A4. 位置编码 — RoPE 原理、扩展方法、2D-RoPE
- A5. 压缩即智能 — 信息论视角与 Scaling Laws 推导
- A6. SSM 与混合架构:Mamba、Jamba、RWKV
- A8. Normalization 技术演进
- A9. Activation 函数与 FFN 设计
- A10. MoD、Early Exit 与动态计算
- A11. 模型设计空间:深度、宽度与 Vocab
- A12. 工业模型架构选型图谱
↑ 上级 · 大语言模型/多模态大模型 LLM/MLLM