G. 推理与部署¶
模型训练完,怎么把推理成本压下去。量化全景(GPTQ / AWQ / SmoothQuant / FP8)、PD 分离与推理架构设计、vLLM vs SGLang 深入对比、主流模型的部署配置、投机解码与 KV Cache 优化、解码策略(Beam Search / 采样 / KV Cache)。
章节¶
- G1. 量化全景:GPTQ / AWQ / SmoothQuant / FP8
- G2. PD 分离与推理架构设计
- G3. vLLM vs SGLang 深入对比与优化
- G4. 主流模型部署配置:Qwen / DeepSeek / LLaMA
- G5. 投机解码与 KV Cache 优化
- G6. 解码策略:Beam Search、采样与 KV Cache
↑ 上级 · 大语言模型/多模态大模型 LLM/MLLM