DeepSeek 深读¶
DeepSeek 是「Tech Report 公开度」最高的实验室之一——V3 / R1 / V3.1 多份 report 把训练 stack 从 infra 到对齐都讲透。重点读:
- 工程:MoE 架构(256 experts × top-8)、FP8 训练 stack、PPO/GRPO 实现细节
- R1 系列:推理时 RL 是如何让模型自学 chain-of-thought 的;纯 RL(无 SFT 冷启动)的可行性边界
子节顺序:
- 工程深读(V3 MoE / FP8 训练 / DualPipe / 通信调度)
- 推理 RL 与方法论(R1 / R1-Zero / GRPO / 数据合成)
↑ 上级 · K. 前沿实验室深读