跳转至

Claude / GPT / DeepSeek 训练方法论还原

更新日期:2026-04-15

本文基于公开论文、泄露的源码(Claude Code)、技术博客、员工访谈、社区逆向分析。涉及大量推测,具体细节以官方为准。

四、DeepSeek 路线

4.1 DeepSeek-V3 训练全程

DeepSeek 是唯一完整公开训练细节的前沿模型。参考 DeepSeek-V3 Technical Report

flowchart LR
    pre["Pretrain<br/>14.8T tokens<br/>FP8 全栈"]
    mid["Mid-train<br/>YaRN 32k→128k<br/>多语言增强"]
    sft["SFT<br/>1.5M conversation<br/>+ 推理 + 代码"]
    rl["RL<br/>GRPO + RLVR"]
    final["DeepSeek-V3"]

    pre --> mid --> sft --> rl --> final

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class pre,mid,sft,rl,final stage

关键创新:

  • MLA (Multi-head Latent Attention)

  • Aux-Loss-Free 负载均衡

  • FP8 混合精度训练(首个大规模验证)

  • 细粒度专家 (256 个)

  • Multi-Token Prediction 辅助 loss

4.2 DeepSeek-R1 训练(推理模型)

flowchart LR
    base["DeepSeek-V3 Base"]
    rzero["R1-Zero<br/>(纯 RL,无 SFT)"]
    cold["R1 Stage 1<br/>Cold-start SFT"]
    rl1["R1 Stage 2<br/>Reasoning RL"]
    reject["R1 Stage 3<br/>Rejection SFT"]
    final_rl["R1 Stage 4<br/>Final RL"]
    r1["DeepSeek-R1"]

    base --> rzero
    base --> cold --> rl1 --> reject --> final_rl --> r1

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    classDef io fill:#f5f3eb,stroke:#bdb9ab,color:#1a1a1a;
    class base,r1 io
    class rzero,cold,rl1,reject,final_rl stage

R1-Zero 的发现是 2025 年 AI 界最震撼的事:不用任何 CoT 标注数据,仅靠 RLVR,模型自发学会了推理、自我验证、回溯。这改变了推理模型训练范式。

4.3 R1-Distill 系列

DeepSeek 开源了 R1-Distill 小模型(Qwen/LLaMA 的 1.5B、7B、14B、32B 版本)。

训练方法

  1. 用完整 R1 模型采样大量带 CoT 的推理过程

  2. 将这些 CoT 作为 SFT 数据训练小模型

  3. 不需要 RL,纯 SFT 就能获得强推理能力

效果: 关键结论:推理能力可以通过蒸馏转移到小模型。


五、关键技术对比

技术 OpenAI Anthropic DeepSeek
对齐核心 RLHF (PPO) Constitutional AI (RLAIF) GRPO + RLVR
偏好数据 人类标注 AI 生成 (宪法) 题目+验证器 (自动)
推理模型 o1/o3 (RL) Claude 4 Extended Thinking R1 (纯 RL)
可解释性 多 (SAE、Circuit)
开源程度 少 (部分数据公开) 中 (论文多) 多 (模型+论文+代码)

六、各家对行业的贡献

厂商 主要贡献
OpenAI 开创 GPT 时代、RLHF、推理模型 (o1)、Scaling Laws 实证
Anthropic Constitutional AI、可解释性研究、Claude 安全优势
DeepSeek MoE 效率革命、FP8 训练、纯 RL 推理、开源大模型
Google Transformer、BERT、MoE (Switch)、Gemini 多模态
Meta LLaMA 开源生态、Scaling Laws、Chinchilla

七、可复现性评估

如果你想复现这些模型的训练,可行性如何?


八、2026 趋势

观察:三家越来越收敛到同一套范式:Base Pretrain → SFT → RL (with verifiable rewards)。差异主要在: - Base model 的架构选择 (Dense vs MoE, MHA vs MLA) - RL 阶段的 reward 设计 (人类 / AI / 可验证) - 数据选择和合成策略


参考文献


上级 · E8. Claude / GPT / DeepSeek 训练方法论还原