Megatron 与 6D 并行:万卡训练的"操作系统"¶
更新日期:2026-04-16
这个话题为什么是训练的第一道门槛¶
一个 70B 模型的权重 = 140GB(FP16),一张 H100 只有 80GB 显存。单卡放不下,就必须并行。但并行不是"切成 N 份扔到 N 张卡上"——不同切法的通信开销差 10 倍,选错了 MFU 可能从 50% 掉到 20%。
故事线¶
经典三维并行:怎么把一个模型切到多张卡上?¶
TP(张量并行)切权重矩阵,PP(流水线并行)切层,DP(数据并行)切 batch。每种切法的通信模式完全不同——TP 用 AllReduce(节点内 NVLink),PP 用 P2P(跨节点),DP 用梯度 AllReduce(可重叠)。ZeRO 进一步把优化器状态分片。选对组合的核心原则:高频通信放 NVLink,低频通信放 IB。
详见 C1.1 TP、PP、DP 与 ZeRO
MoE 和长序列带来的新维度:EP、CP、SP¶
MoE 模型的 FFN 层需要 Expert Parallelism(All-to-All 通信,和 TP 的 AllReduce 模式完全不同)。128K+ 序列需要 Context Parallelism(Ring Attention,计算和通信重叠)。Sequence Parallelism 配合 TP 减少 LayerNorm 的激活内存。6D 并行的配置空间巨大——DeepSeek-V3 甚至完全不用 TP。
详见 C1.2 EP、CP、SP 与通信重叠
↑ 上级 · C. 分布式训练基础设施