OpenAI 工程深读¶
更新日期:2026-04-26
OpenAI 公开技术诚意比 Anthropic 弱,比 DeepSeek 弱很多。但有几条线可以从 System Card、blog post、partner 公开声明、GPT-OSS 开源权重 + 庭审文件 / 访谈拼出来。
主要参考:
- GPT-4 Technical Report (2023)
- GPT-4 System Card (2023)
- GPT-4o System Card (2024)
- Learning to Reason with LLMs (o1 blog)
- o1 System Card (2024)
- GPT-OSS releases (2025) (20B / 120B 开源权重)
一、GPT-4 / GPT-4o 架构推测¶
OpenAI 不公开架构细节。社区拼图:
1.1 GPT-4 (March 2023)¶
| 项 | 值 | 来源 |
|---|---|---|
| 总参数 | ~1.76 T | SemiAnalysis 报告 (待核实) |
| MoE 结构 | 8 expert × ~220B + top-2 routing | SemiAnalysis (Dylan Patel) |
| 激活参数 | ~280 B | 2 experts active |
| 训练 token | ~13 T | 推测 |
| 上下文 | 8k → 32k → 128k | 多次扩展 |
| Context window | 32k 之后用 dialing-up |
注意:以上数字全部是 leak / 推测,OpenAI 从未官方确认。
1.2 GPT-4o (May 2024)¶
GPT-4o 的关键进化是原生多模态:
- Omni 设计:单一模型处理文本 / 图像 / 音频,不是 cascade 多个专门模型
- Audio tokenizer:声音 → discrete token(类似 Whisper 但训练时和 LM 联合优化)
- Image tokenizer:图 patch → discrete token(类似 CLIP 但训练时联合)
1.3 GPT-OSS 提供的实证¶
2025 OpenAI 开源 gpt-oss-20b 和 gpt-oss-120b。这是第一次能直接看到 OpenAI 的真实架构。
| 项 | gpt-oss-20b | gpt-oss-120b | 备注 |
|---|---|---|---|
| 总参数 | 20.9 B | 116.8 B | |
| Active 参数 | 3.6 B | 5.1 B | MoE |
| Layers | 24 | 36 | |
| Hidden | 2880 | 2880 | 同 d_model 不同深度 |
| Heads | 64 (8 KV) | 64 (8 KV) | GQA(8) |
| Context | 128 k | 128 k | |
| Routing | top-4 / 32 expert | top-4 / 128 expert | |
| Activation | SwiGLU | SwiGLU |
观察:
- 用 GQA 而非 MLA(更保守)
- 用 standard MoE + top-4(不是 DeepSeek 的 256-expert 极端稀疏)
- 没有 shared expert(不像 DeepSeek-V3)
- 训练 token 量 / 数据来源全没公开
GPT-OSS 是 OpenAI 历史上唯一开源的非顶级模型,可能不能完全代表 GPT-4 / o 系列,但是最接近的实证参考。
二、o1 / o3 推理时 RL¶
2.1 公开信息¶
- 2024.09 发布 o1-preview / o1-mini
- 2024.12 o1 / o1 pro
- 2025 o3 / o3-mini / o3-pro
- 2026 GPT-5(猜测整合 o-line 推理能力)
OpenAI 对 o 系列的工程细节比 GPT-4 更保密。已知:
- 训练时 RL 加 chain-of-thought:模型在回答前生成"思考"序列
- reward 来自答案正确性(数学 / 代码 / 推理)
- reasoning token 隐藏给用户(API 不返回),只给 summary
2.2 跟 DeepSeek-R1 对比¶
| 维度 | OpenAI o1 | DeepSeek-R1 |
|---|---|---|
| 公开度 | 极低(System Card 只有 high-level) | 高(完整 paper) |
| Reward 类型 | 推测 RM-based + 规则验证 | 规则验证为主 |
| Reasoning 是否暴露 | 隐藏(summary only) | 完全暴露(<think>) |
| Pricing | 高(推理时长) | 中 |
| 数学 benchmark | AIME ~74-83% (o1) | AIME ~71-79% (R1) |
关键问题:OpenAI 是怎么训出 o1 的?
社区推测路线(待核实):
- Self-play RL with verifier rewards(类似 R1)
- Process Reward Model (PRM):除了答案 reward 还奖励中间步骤(OpenAI 之前发过 Let's Verify Step by Step 用 PRM)
- Search at training time:MCTS-like exploration during RL training(类似 AlphaZero 但应用到语言)
OpenAI 的博客只说 "we use large-scale reinforcement learning",无具体算法名。
2.3 OpenAI 历史 PRM 工作¶
Let's Verify Step by Step (Lightman et al. 2023) 是 OpenAI 公开的 PRM 工作:
- 收集 800k 个step-level human label("这一步推理对吗?")
- 训 PRM 给中间步骤打分
- 推理时用 PRM 做 best-of-N selection
但 2023 PRM 是 inference-time tool(best-of-N),不是 training-time signal。o1 把 PRM 信号引入训练是合理推测但未公开证实。
2.4 GPT-5 / Reasoning 整合(2025-2026)¶
GPT-5(2025-2026 释出,待核实具体日期)整合了 reasoning + chat:模型自动决定何时"思考"。
工程推测:
- 单一模型,包含两种行为模式
- Router / classifier 决定 thinking budget
- Latency-quality tradeoff 通过 budget 控制
三、训练 infra¶
3.1 硬件 stack¶
公开(partner 声明):
- Microsoft Azure:主合作伙伴,提供大部分训练算力
- Stargate:2024-2025 OpenAI + Microsoft + Oracle + SoftBank 联合数据中心计划,~$500B 投资
- NVIDIA H100 / B200:主要 GPU
- TPU 也用了(GPT-3.5 时代部分训练)
3.2 GPT-4 训练故事(来自 Sutskever / Karpathy 访谈)¶
知名公开细节:
- 训练失败次数多:GPT-4 training run 不是一次成功,多次重启
- Hardware failure 是常态:千卡集群每周丢几张
- Loss spike:训练曲线不是平滑下降,有 spike 需要回退
- 预测 loss 曲线:OpenAI 用 scaling law 预测最终 loss 偏差 < 1%(GPT-4 paper)
Sutskever Lex Fridman 访谈 2024 透露:
- "we didn't know GPT-4 would work until we ran it"
- 工程团队需要 24/7 watch checkpoint,hand-tune 处理 spike
3.3 失败模式(Stochastic Parrots / Karpathy)¶
Karpathy 在 Microsoft 2023 talks 提及 GPT-4 训练的 fail mode(推测,不是 verbatim):
- Loss spike → 回退 100 step + LR / data shuffle 重训
- NaN gradient → batch 跳过
- 单机 OOM → expert 重新分配
- IB 网络抖动 → 整轮重启
这些跟 DeepSeek tech report 第 9 节描述的 fail mode 高度一致,说明业界训练大规模 LLM 的 fail mode 是普适的。
四、Inference 优化¶
4.1 Speculative Decoding 贡献¶
OpenAI 团队发表过 Fast Inference from Transformers via Speculative Decoding (Leviathan et al. 2022) — 投机解码奠基论文。
核心:
- Draft model(小) 提议下 K 个 token
- Target model(大)一次 forward 验证 K 个 token
- 接受 prefix(rejection sampling 保证分布等价)
实际加速:1.5-3× 取决于 draft model 质量。
4.2 Batching / Continuous batching¶
OpenAI 推理 stack 不公开,但 ChatGPT 服务上千万用户的工程需求推测:
- Continuous batching(vLLM 那种)—— 不同 user 的 prompt 在同一 GPU 上 mix
- PD 分离:prefill workers + decode workers 不同硬件配置(推测)
- KV Cache pooling:相同前缀的 prompt(system prompt)共享 KV
4.3 Reasoning token caching (o-series)¶
o 系列推理时长是问题(长 reasoning chain)。OpenAI 推测优化:
- Reasoning prefix caching:相似 prompt 的 reasoning 起步可复用
- Adaptive thinking budget:根据问题难度动态分配 reasoning 长度
- Prompt-aware draft model:投机解码的 draft 也有 reasoning 能力
具体细节不公开。
五、API 工程¶
5.1 Function Calling¶
OpenAI 2023.06 推出 function calling,是工业上最早的 LLM 工具调用标准。
# 标准 OpenAI function calling
response = client.chat.completions.create(
model="gpt-4",
messages=[{"role": "user", "content": "What's the weather in Beijing?"}],
tools=[{
"type": "function",
"function": {
"name": "get_weather",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}}
}
}
}]
)
# response.tool_calls[0] = {"name": "get_weather", "arguments": '{"city": "Beijing"}'}
设计取舍:
- JSON Schema 表达 tool signature(类型化好,但表达力有限)
- 单轮 model 输出 ≤1 个 tool call(早期)→ 多 call 同时(2024 后)
- 不支持 streaming tool call(直到 2025 才加)
5.2 Assistants API(已 deprecate)¶
2023.11 OpenAI 推 Assistants API(带状态管理 + thread + tool 的"管家")。但 2025 宣布 deprecate(社区反馈太复杂、慢、贵),改推 Responses API(更简洁)。
5.3 跟 MCP / Anthropic 对比¶
OpenAI tooling 是封闭生态(function calling 是 OpenAI-specific schema),跟 Anthropic 的 MCP 走开放协议不同。但 GPT-5 时代 OpenAI 可能也支持 MCP(待核实)。
六、模型代际对比¶
| 模型 | 发布 | 上下文 | 主要能力 gain | 备注 |
|---|---|---|---|---|
| GPT-3 | 2020.05 | 2k | scale | dense, 175B |
| GPT-3.5-turbo | 2022.11 | 4k → 16k | RLHF | InstructGPT 衍生 |
| GPT-4 | 2023.03 | 8k → 32k → 128k | reasoning | MoE 1.76T (推测) |
| GPT-4 Turbo | 2023.11 | 128k | 速度 / 成本 | |
| GPT-4o | 2024.05 | 128k | omni-modal | 文本+图+音 |
| o1-preview / o1 | 2024.09-12 | 128k | reasoning | 推理时 RL |
| o3 | 2025 | 128k+ | reasoning ++ | ARC-AGI 突破 |
| GPT-4.5 (Orion) | 2025.02 | 128k | scale | base model 大版本 |
| GPT-5 | 2025-2026 | 待核实 | 推理整合 | 可能 reasoning 内生 |
| GPT-OSS 20B/120B | 2025 | 128k | open weights | 唯一开源 |
七、复现度自评¶
| 组件 | 公开度 | 复现难度 |
|---|---|---|
| GPT-4 架构 | leak only | ❌(不知道真假) |
| Function calling | ✅ Schema 公开 | ✅ 完全可实现 |
| Speculative decoding | ✅ Paper | ✅ |
| PRM (step-level reward) | ✅ Paper | ✅(数据贵) |
| o1 reasoning RL | ❌ | ❌(自己摸) |
| Reasoning RL alternatives (R1 路线) | ✅(不是 OpenAI 但 DeepSeek 公开) | ✅ |
| GPT-OSS 实际架构 | ✅ 开源 | ✅ |
给 读者实操建议:
- 想要 GPT-4 级别 base,路径:自己 scale dense 模型(开销巨大),或者用开源 MoE 替代(V3 / K2)
- 想要 o1 级别 reasoning,路径:用 DeepSeek-R1 路线(完全公开),不要纠结 OpenAI 的细节
- 想要 function calling 能力,路径:MCP 标准(更现代)+ 自己微调 schema 输出
- GPT-OSS 是好的参考实现 —— 看真实生产 LLM 的架构选择(GQA over MLA, top-4 over top-8 等)
总结¶
- OpenAI 公开度低,但 GPT-OSS 提供了实证参考 —— 看他们没用 MLA、没用 shared expert,可能反映了他们的工程取舍
- o 系列 reasoning RL 黑箱,复现得用 R1 路线 —— DeepSeek 的工作降低了 OpenAI 在这个赛道的护城河
- Function calling / Assistants 设计是产业级 lessons,但不是 unique tech;MCP / Anthropic 协议更开放
- 训练 fail mode 普适:跟 DeepSeek 报告对照,可以拼出"千卡 LLM 训练的统一 fail-mode 清单"
- 不应过度神化 OpenAI 工程 —— 公开材料看,他们的 stack 跟 NVIDIA + PyTorch 主流路径接近
参考文献¶
- OpenAI. GPT-4 Technical Report. 2023. arXiv:2303.08774
- OpenAI. GPT-4 System Card. 2023. openai.com
- OpenAI. GPT-4o System Card. 2024.
- OpenAI. Learning to Reason with LLMs (o1). 2024. openai.com/index/learning-to-reason-with-llms
- OpenAI. o1 System Card. 2024.
- Lightman et al. Let's Verify Step by Step (PRM). 2023. arXiv:2305.20050
- Leviathan et al. Fast Inference from Transformers via Speculative Decoding. 2022. arXiv:2211.17192
- gpt-oss — OpenAI 开源 20B / 120B 模型权重
- Ouyang et al. InstructGPT (RLHF for LLMs). 2022. arXiv:2203.02155
- SemiAnalysis (Dylan Patel). GPT-4 Architecture leak analysis. 2023.
↑ 上级 · OpenAI