术语表
更新日期:2026-04-15
A
| 术语 |
全称 |
含义 |
| AdamW |
Adam + Weight Decay |
带解耦权重衰减的 Adam 优化器 |
| AGI |
Artificial General Intelligence |
通用人工智能 |
| ALiBi |
Attention with Linear Biases |
线性偏置位置编码 |
| AllReduce |
- |
集合通信, 所有节点获得相同结果 |
| All-to-All |
- |
MoE 专家并行的通信模式 |
| AnyRes |
- |
动态分辨率方案 |
| AutoGPTQ |
- |
GPTQ 量化工具 |
| AWQ |
Activation-aware Weight Quantization |
激活感知量化 |
B
| 术语 |
全称 |
含义 |
| BF16 |
Brain Float 16 |
16 位浮点, 范围同 FP32 |
| BPE |
Byte Pair Encoding |
子词分词算法 |
C
| 术语 |
全称 |
含义 |
| CoT |
Chain of Thought |
思维链 |
| CP |
Context Parallelism |
上下文并行 |
| CUDA |
Compute Unified Device Architecture |
NVIDIA GPU 编程平台 |
| CE Loss |
Cross-Entropy Loss |
交叉熵损失 |
D
| 术语 |
全称 |
含义 |
| DDP |
Distributed Data Parallel |
分布式数据并行 |
| DiT |
Diffusion Transformer |
扩散 Transformer |
| DP |
Data Parallelism |
数据并行 |
| DPO |
Direct Preference Optimization |
直接偏好优化 |
| DSA |
DeepSeek Sparse Attention |
DeepSeek 稀疏注意力 |
E
| 术语 |
全称 |
含义 |
| EP |
Expert Parallelism |
专家并行 (MoE 专用) |
| ELO |
- |
对战排名系统 (来自国际象棋) |
| Embedding |
- |
词向量 / 嵌入表示 |
| Evol-Instruct |
- |
迭代复杂化指令方法 |
F
| 术语 |
全称 |
含义 |
| FFN |
Feed-Forward Network |
前馈网络 |
| FlashAttention |
- |
高效注意力 kernel |
| FLOPs |
Floating Point Operations |
浮点运算 |
| FP8 / E4M3 / E5M2 |
- |
8 位浮点格式 |
| FSDP |
Fully Sharded Data Parallel |
完全分片数据并行 |
G
| 术语 |
全称 |
含义 |
| GPTQ |
- |
基于 Hessian 的量化方法 |
| GQA |
Grouped Query Attention |
分组查询注意力 |
| GRPO |
Group Relative Policy Optimization |
组内相对策略优化 |
| GGUF |
GPT-Generated Unified Format |
llama.cpp 量化格式 |
| GLA |
Gated Linear Attention |
门控线性注意力 |
H
| 术语 |
全称 |
含义 |
| HBM |
High Bandwidth Memory |
GPU 的高带宽内存 |
| HLE |
Humanity's Last Exam |
前沿综合基准 |
I
| 术语 |
全称 |
含义 |
| IB |
InfiniBand |
高速网络 |
| IF |
Instruction Following |
指令遵循 |
| IFEval |
- |
指令遵循评测 |
| INT4/INT8 |
- |
4/8 位整数 |
K
| 术语 |
全称 |
含义 |
| KV Cache |
Key-Value Cache |
注意力的键值缓存 |
| KTO |
Kahneman-Tversky Optimization |
只需二元标签的对齐方法 |
L
| 术语 |
全称 |
含义 |
| LLM |
Large Language Model |
大语言模型 |
| LoRA |
Low-Rank Adaptation |
低秩适配器 |
| LR |
Learning Rate |
学习率 |
M
| 术语 |
全称 |
含义 |
| Mamba |
- |
选择性状态空间模型 |
| MCP |
Model Context Protocol |
模型上下文协议 (Anthropic) |
| MFU |
Model FLOPs Utilization |
模型浮点利用率 |
| MHA |
Multi-Head Attention |
多头注意力 |
| MLA |
Multi-head Latent Attention |
多头潜注意力 (DeepSeek) |
| MLLM |
Multimodal LLM |
多模态大模型 |
| MoE |
Mixture of Experts |
专家混合 |
| MQA |
Multi-Query Attention |
多查询注意力 |
| 术语 |
全称 |
含义 |
| MTP |
Multi-Token Prediction |
多 token 预测 |
| Muon |
- |
正交化梯度优化器 |
| μP |
Maximal Update Parameterization |
超参迁移方法 |
N
| 术语 |
全称 |
含义 |
| NCCL |
NVIDIA Collective Communications Library |
NVIDIA 集合通信库 |
| NoPE |
No Position Encoding |
无位置编码 |
| NTK |
Neural Tangent Kernel |
用于 RoPE 外推 |
| NVLink |
- |
NVIDIA GPU 互联 |
P
| 术语 |
全称 |
含义 |
| PagedAttention |
- |
vLLM 的分页 KV Cache |
| PD 分离 |
Prefill-Decode Disaggregation |
推理中分离 prefill 和 decode |
| PEFT |
Parameter-Efficient Fine-Tuning |
参数高效微调 |
| PP |
Pipeline Parallelism |
流水线并行 |
| PPO |
Proximal Policy Optimization |
近端策略优化 |
| PPL |
Perplexity |
困惑度 |
| PRM |
Process Reward Model |
过程奖励模型 |
Q
| 术语 |
全称 |
含义 |
| QLoRA |
- |
量化 + LoRA 微调 |
| Q-Former |
Query Transformer |
BLIP-2 的投影层 |
R
| 术语 |
全称 |
含义 |
| RadixAttention |
- |
SGLang 的基数树 KV Cache |
| RAG |
Retrieval-Augmented Generation |
检索增强生成 |
| RFT |
Rejection Fine-Tuning |
拒绝采样微调 |
| RLHF |
RL from Human Feedback |
人类反馈强化学习 |
| RLAIF |
RL from AI Feedback |
AI 反馈强化学习 |
| RLVR |
RL with Verifiable Rewards |
可验证奖励强化学习 |
| RLVRR |
RL with Reference-based Verifiable Rewards |
基于参考的可验证奖励 |
| RMSNorm |
Root Mean Square Normalization |
均方根归一化 |
| 术语 |
全称 |
含义 |
| RoPE |
Rotary Position Embedding |
旋转位置编码 |
S
| 术语 |
全称 |
含义 |
| SAE |
Sparse Autoencoder |
稀疏自编码器 (可解释性) |
| SFT |
Supervised Fine-Tuning |
监督微调 |
| SigLIP |
Sigmoid Loss for Language-Image Pre-training |
CLIP 改进版 |
| SimPO |
Simple Preference Optimization |
无参考的偏好优化 |
| SP |
Sequence Parallelism |
序列并行 |
| SSM |
State Space Model |
状态空间模型 |
| SwiGLU |
- |
门控线性单元激活 |
T
| 术语 |
全称 |
含义 |
| TileLang |
- |
Tile 级 GPU DSL |
| Token |
- |
分词后的单元 |
| TP |
Tensor Parallelism |
张量并行 |
| Triton |
- |
Python-like GPU DSL |
| TTFT |
Time To First Token |
首 token 延迟 |
V
| 术语 |
全称 |
含义 |
| VAE |
Variational Autoencoder |
变分自编码器 |
| VLA |
Vision-Language-Action |
视觉语言动作模型 |
| vLLM |
- |
高性能推理框架 |
| VLM |
Vision-Language Model |
视觉语言模型 |
| ViT |
Vision Transformer |
视觉 Transformer |
W
| 术语 |
全称 |
含义 |
| Warmup |
- |
学习率预热 |
| WebDataset |
- |
大规模数据集格式 |
Y
| 术语 |
全称 |
含义 |
| YaRN |
Yet another RoPE extensioN |
RoPE 外推方法 |
Z
| 术语 |
全称 |
含义 |
| Zero Bubble PP |
- |
零气泡流水线并行 |
| ZeRO |
Zero Redundancy Optimizer |
分片优化器 |
常用缩写(字母顺序)
A-M: AdamW, ALiBi, AWQ, BF16, BPE, CoT, CP, DP, DPO, EP, FFN, GQA, GRPO, KV, LLM, LoRA, MFU, MLA, MoE, MTP
N-Z: NCCL, PP, PPO, RLHF, RLVR, RoPE, SFT, SP, TP, VLM, YaRN, ZeRO
↑ 上级 · Z. 附录