跳转至

A. 基础理论

主流 LLM 的"骨架"层:Transformer 架构、注意力变体、MoE、位置编码、归一化、激活函数、SSM 替代方案,以及 Scaling Laws 的信息论基础。Decoder-only Transformer + GQA + RMSNorm Pre-Norm + RoPE + SwiGLU + BPE(vocab ≥ 100K)—— 2024 年之后几乎所有 Dense 模型都收敛到这个配方,本章拆开每一块讲为什么。

章节


上级 · 大语言模型/多模态大模型 LLM/MLLM