跳转至

术语表

更新日期:2026-04-15


A

术语 全称 含义
AdamW Adam + Weight Decay 带解耦权重衰减的 Adam 优化器
AGI Artificial General Intelligence 通用人工智能
ALiBi Attention with Linear Biases 线性偏置位置编码
AllReduce - 集合通信, 所有节点获得相同结果
All-to-All - MoE 专家并行的通信模式
AnyRes - 动态分辨率方案
AutoGPTQ - GPTQ 量化工具
AWQ Activation-aware Weight Quantization 激活感知量化

B

术语 全称 含义
BF16 Brain Float 16 16 位浮点, 范围同 FP32
BPE Byte Pair Encoding 子词分词算法

C

术语 全称 含义
CoT Chain of Thought 思维链
CP Context Parallelism 上下文并行
CUDA Compute Unified Device Architecture NVIDIA GPU 编程平台
CE Loss Cross-Entropy Loss 交叉熵损失

D

术语 全称 含义
DDP Distributed Data Parallel 分布式数据并行
DiT Diffusion Transformer 扩散 Transformer
DP Data Parallelism 数据并行
DPO Direct Preference Optimization 直接偏好优化
DSA DeepSeek Sparse Attention DeepSeek 稀疏注意力

E

术语 全称 含义
EP Expert Parallelism 专家并行 (MoE 专用)
ELO - 对战排名系统 (来自国际象棋)
Embedding - 词向量 / 嵌入表示
Evol-Instruct - 迭代复杂化指令方法

F

术语 全称 含义
FFN Feed-Forward Network 前馈网络
FlashAttention - 高效注意力 kernel
FLOPs Floating Point Operations 浮点运算
FP8 / E4M3 / E5M2 - 8 位浮点格式
FSDP Fully Sharded Data Parallel 完全分片数据并行

G

术语 全称 含义
GPTQ - 基于 Hessian 的量化方法
GQA Grouped Query Attention 分组查询注意力
GRPO Group Relative Policy Optimization 组内相对策略优化
GGUF GPT-Generated Unified Format llama.cpp 量化格式
GLA Gated Linear Attention 门控线性注意力

H

术语 全称 含义
HBM High Bandwidth Memory GPU 的高带宽内存
HLE Humanity's Last Exam 前沿综合基准

I

术语 全称 含义
IB InfiniBand 高速网络
IF Instruction Following 指令遵循
IFEval - 指令遵循评测
INT4/INT8 - 4/8 位整数

K

术语 全称 含义
KV Cache Key-Value Cache 注意力的键值缓存
KTO Kahneman-Tversky Optimization 只需二元标签的对齐方法

L

术语 全称 含义
LLM Large Language Model 大语言模型
LoRA Low-Rank Adaptation 低秩适配器
LR Learning Rate 学习率

M

术语 全称 含义
Mamba - 选择性状态空间模型
MCP Model Context Protocol 模型上下文协议 (Anthropic)
MFU Model FLOPs Utilization 模型浮点利用率
MHA Multi-Head Attention 多头注意力
MLA Multi-head Latent Attention 多头潜注意力 (DeepSeek)
MLLM Multimodal LLM 多模态大模型
MoE Mixture of Experts 专家混合
MQA Multi-Query Attention 多查询注意力
术语 全称 含义
MTP Multi-Token Prediction 多 token 预测
Muon - 正交化梯度优化器
μP Maximal Update Parameterization 超参迁移方法

N

术语 全称 含义
NCCL NVIDIA Collective Communications Library NVIDIA 集合通信库
NoPE No Position Encoding 无位置编码
NTK Neural Tangent Kernel 用于 RoPE 外推
NVLink - NVIDIA GPU 互联

P

术语 全称 含义
PagedAttention - vLLM 的分页 KV Cache
PD 分离 Prefill-Decode Disaggregation 推理中分离 prefill 和 decode
PEFT Parameter-Efficient Fine-Tuning 参数高效微调
PP Pipeline Parallelism 流水线并行
PPO Proximal Policy Optimization 近端策略优化
PPL Perplexity 困惑度
PRM Process Reward Model 过程奖励模型

Q

术语 全称 含义
QLoRA - 量化 + LoRA 微调
Q-Former Query Transformer BLIP-2 的投影层

R

术语 全称 含义
RadixAttention - SGLang 的基数树 KV Cache
RAG Retrieval-Augmented Generation 检索增强生成
RFT Rejection Fine-Tuning 拒绝采样微调
RLHF RL from Human Feedback 人类反馈强化学习
RLAIF RL from AI Feedback AI 反馈强化学习
RLVR RL with Verifiable Rewards 可验证奖励强化学习
RLVRR RL with Reference-based Verifiable Rewards 基于参考的可验证奖励
RMSNorm Root Mean Square Normalization 均方根归一化
术语 全称 含义
RoPE Rotary Position Embedding 旋转位置编码

S

术语 全称 含义
SAE Sparse Autoencoder 稀疏自编码器 (可解释性)
SFT Supervised Fine-Tuning 监督微调
SigLIP Sigmoid Loss for Language-Image Pre-training CLIP 改进版
SimPO Simple Preference Optimization 无参考的偏好优化
SP Sequence Parallelism 序列并行
SSM State Space Model 状态空间模型
SwiGLU - 门控线性单元激活

T

术语 全称 含义
TileLang - Tile 级 GPU DSL
Token - 分词后的单元
TP Tensor Parallelism 张量并行
Triton - Python-like GPU DSL
TTFT Time To First Token 首 token 延迟

V

术语 全称 含义
VAE Variational Autoencoder 变分自编码器
VLA Vision-Language-Action 视觉语言动作模型
vLLM - 高性能推理框架
VLM Vision-Language Model 视觉语言模型
ViT Vision Transformer 视觉 Transformer

W

术语 全称 含义
Warmup - 学习率预热
WebDataset - 大规模数据集格式

Y

术语 全称 含义
YaRN Yet another RoPE extensioN RoPE 外推方法

Z

术语 全称 含义
Zero Bubble PP - 零气泡流水线并行
ZeRO Zero Redundancy Optimizer 分片优化器

常用缩写(字母顺序)

A-M: AdamW, ALiBi, AWQ, BF16, BPE, CoT, CP, DP, DPO, EP, FFN, GQA, GRPO, KV, LLM, LoRA, MFU, MLA, MoE, MTP

N-Z: NCCL, PP, PPO, RLHF, RLVR, RoPE, SFT, SP, TP, VLM, YaRN, ZeRO


上级 · Z. 附录