附录D 术语表

附录D 术语表

AI Infra 领域的术语和缩写极多。这份术语表收录了本书中出现的关键术语,按字母顺序排列。

D.1 中英文对照术语表

A

英文 中文 简要说明
Activation Checkpointing 激活检查点 训练中用重计算换内存的技术
Adapter 适配器 插入到预训练模型中的小型可训练模块
All-Gather 全收集 分布式通信原语,所有节点收集所有数据
All-Reduce 全规约 分布式通信原语,所有节点聚合结果
Attention 注意力(机制) Transformer 的核心计算模块
Auto-regressive 自回归 逐 token 生成文本的方式
AWQ 激活感知权重量化 一种 4-bit 量化方法

B

英文 中文 简要说明
Backpropagation 反向传播 计算梯度的标准算法
Batch Size 批大小 一次前向/反向处理的样本数
Beam Search 束搜索 生成时维护多个候选序列的解码策略
BF16 (Bfloat16) 脑浮点16 Google 推出的 16 位浮点格式,动态范围大
Byte-Pair Encoding (BPE) 字节对编码 最常用的子词分词算法

C

英文 中文 简要说明
Cache 缓存 存储中间结果以加速后续计算
Checkpoint 检查点 训练中保存的模型状态快照
Chinchilla Scaling Laws Chinchilla 缩放定律 模型参数和训练数据的最优配比(约 20:1)
Chunked Prefill 分块预填充 将长 prompt 的 prefill 拆分成块处理
Continuous Batching 连续批处理 动态调整 batch 中的请求,提高吞吐
CUDA CUDA NVIDIA 的 GPU 并行计算平台

D

英文 中文 简要说明
Data Parallelism 数据并行 将数据分到不同 GPU,每 GPU 有完整模型副本
Decoder 解码器 Transformer 中负责生成的部分
DeepSpeed DeepSpeed 微软开发的分布式训练框架
Distillation 蒸馏 用大模型训练小模型的技术
Distributed Training 分布式训练 多 GPU/多机协同训练

E

英文 中文 简要说明
Embedding 嵌入/向量化 将离散 token 映射为连续向量
Encoder 编码器 Transformer 中负责理解输入的部分
Expert 专家 MoE 架构中的子网络
Expert Parallelism 专家并行 将 MoE 的不同 expert 放在不同 GPU 上

F

英文 中文 简要说明
Fine-tuning 微调 在预训练模型上继续训练
FlashAttention 闪速注意力 IO-aware 的注意力优化算法
FLOPS 每秒浮点运算次数 衡量计算性能的单位
FP16 半精度浮点 16 位浮点格式
FP8 8 位浮点 最新的低精度训练/推理格式
FP4 4 位浮点 极低精度格式(Blackwell 支持)
FSDP 完全分片数据并行 PyTorch 的 ZeRO-3 等价方案
Fusion 算子融合 将多个小 kernel 合并为一个大 kernel

G

英文 中文 简要说明
Generation 生成 模型输出文本/图像的过程
Goodput 有效吞吐量 满足 SLO 的请求吞吐量
GPUDirect RDMA GPU 直接远程内存访问 GPU 之间直接通信,不经过 CPU
Gradient Accumulation 梯度累积 多次小 batch 的梯度累加后再更新
Gradient Checkpointing 梯度检查点 同激活检查点
GPTQ GPT 量化 一种训练后权重量化方法
Group Query Attention (GQA) 分组查询注意力 多个 query 共享 key/value head

H

英文 中文 简要说明
HBM 高带宽内存 GPU 上的高带宽显存
HFU 硬件 FLOPS 利用率 含重计算的实际硬件利用率
Hidden Size 隐藏维度 Transformer 中间表示的维度

I

英文 中文 简要说明
Inference 推理 使用训练好的模型生成结果
InfiniBand 无限带宽 高性能计算网络标准
INT8 8 位整数 量化格式之一
KV Cache KV 缓存 存储已计算的 Key/Value 以避免重复计算

K

英文 中文 简要说明
Kernel 核函数/计算核 GPU 上执行的基本计算单元
Key-Value Cache 键值缓存 同 KV Cache
KV Cache Compression KV 缓存压缩 减少 KV Cache 内存占用的技术

L

英文 中文 简要说明
Layer 神经网络的基本组成单元
Learning Rate 学习率 控制参数更新步长
LoRA 低秩适配 在冻结权重上添加低秩矩阵的微调方法
LoRA 低秩适配器 参数高效微调的主流方法

M

英文 中文 简要说明
Megatron-LM Megatron-LM NVIDIA 的大模型训练框架
Memory Bandwidth 内存带宽 数据从显存到计算单元的传输速率
MFU 模型 FLOPS 利用率 实际计算量与理论峰值之比
Mixture of Experts (MoE) 混合专家模型 每次只激活部分专家的稀疏模型架构
MLOps 机器学习运维 ML 系统的开发和运维实践
Model Parallelism 模型并行 将模型分到不同 GPU 上
Multi-Head Attention (MHA) 多头注意力 多个注意力头并行计算
Multi-Query Attention (MQA) 多查询注意力 多个 query 共享一组 key/value

N

英文 中文 简要说明
NCCL NVIDIA 集合通信库 GPU 间高性能通信库
Next-Token Prediction 下一 token 预测 语言模型的核心训练目标
NPU 神经网络处理器 专用 AI 加速芯片(如华为昇腾)
NVLink NVLink NVIDIA GPU 间的高速互联

O

英文 中文 简要说明
Operator Fusion 算子融合 将多个操作合并为一个
Over-subscription 超额订阅 分配的资源超过物理资源总量

P

英文 中文 简要说明
PagedAttention 分页注意力 vLLM 提出的 KV Cache 分页管理方案
Pipeline Parallelism 流水线并行 将模型按层分到不同 GPU,形成流水线
Pipeline Bubble 流水线气泡 流水线并行中的空闲时间
PUE 数据中心能效比 数据中心总能耗与 IT 设备能耗之比
Prefill 预填充 处理输入 prompt 生成 KV Cache 的阶段
Prefix Caching 前缀缓存 缓存公共 prompt 的 KV Cache

Q

英文 中文 简要说明
QLoRA 量化低秩适配 对量化模型做 LoRA 微调
Quantization 量化 降低模型参数精度以减少内存和计算

R

英文 中文 简要说明
RDMA 远程直接内存访问 不经过 CPU 的网络数据传输
Reasoning 推理/推理 模型的推理过程(注意与 Inference 区分语境)
Recomputation 重计算 丢弃中间激活,需要时重新计算
Reduce-Scatter 规约分散 分布式通信原语
RLHF 人类反馈强化学习 用人类偏好训练模型对齐
Ring Attention 环形注意力 跨 GPU 分块计算超长序列的注意力
RoCE 融合以太网上的 RDMA 在标准以太网上实现 RDMA
RoPE 旋转位置编码 主流的位置编码方式

S

英文 中文 简要说明
Scheduler 调度器 决定何时执行哪个任务
Sequence Length 序列长度 输入/输出的 token 数
Sharding 分片 将数据/参数分布到多个设备
Speculative Decoding 推测解码 用小模型预测 + 大模型验证的加速方法
SLO 服务等级目标 对外承诺的性能指标
State Space Model (SSM) 状态空间模型 Transformer 的替代架构
Streaming 流式 逐 token 返回结果的生成方式

T

英文 中文 简要说明
Tensor 张量 多维数组,深度学习的基本数据结构
Tensor Core 张量核心 GPU 中专门执行矩阵乘法的单元
Tensor Parallelism 张量并行 将单个矩阵运算分到多 GPU
TensorRT-LLM TensorRT-LLM NVIDIA 的 LLM 推理优化引擎
Throughput 吞吐量 单位时间处理的请求数/token 数
Token 词元 模型处理的最小文本单位
Tokenization 分词 将文本分割为 token 的过程
TPOT 每输出 Token 延迟 生成每个 token 的平均时间
Training 训练 调整模型参数的过程

V

英文 中文 简要说明
vLLM vLLM 最流行的开源 LLM 推理引擎
Vector Database 向量数据库 存储和检索向量嵌入的专用数据库

W

英文 中文 简要说明
Wall-clock Time 实际运行时间 从开始到结束经过的真实时间
Weight 权重 模型的可学习参数

Z

英文 中文 简要说明
Zero Redundancy Optimizer (ZeRO) 零冗余优化器 DeepSpeed 的核心优化方案
Zero-shot 零样本 不给示例直接要求模型完成任务

D.2 缩写全称对照表

缩写 全称 中文含义
BF16 Brain Floating Point 16-bit 16位脑浮点数
BPE Byte-Pair Encoding 字节对编码
CAS Compare-And-Swap 比较并交换(原子操作)
CLI Command Line Interface 命令行界面
CPO Co-Packaged Optics 共封装光学
CUDA Compute Unified Device Architecture 统一计算设备架构
DCLM Data Compartment Language Model 数据隔离语言模型
DDP DistributedDataParallel 分布式数据并行
DLC Direct Liquid Cooling 直接液体冷却
DPO Direct Preference Optimization 直接偏好优化
FFT Fast Fourier Transform 快速傅里叶变换
FP Floating Point 浮点数
FSDP Fully Sharded Data Parallel 完全分片数据并行
FT Fine-Tuning 微调
GQA Grouped Query Attention 分组查询注意力
HFU Hardware FLOPS Utilization 硬件 FLOPS 利用率
HBM High Bandwidth Memory 高带宽内存
IB InfiniBand 无限带宽网络
I/O Input/Output 输入/输出
KV Key-Value 键值对
LoRA Low-Rank Adaptation 低秩适配
MAU Monthly Active Users 月活跃用户
MFU Model FLOPS Utilization 模型 FLOPS 利用率
MHA Multi-Head Attention 多头注意力
MLA Multi-head Latent Attention 多头潜在注意力(DeepSeek)
MoE Mixture of Experts 混合专家
MQA Multi-Query Attention 多查询注意力
NCCL NVIDIA Collective Communications Library NVIDIA 集合通信库
NIC Network Interface Card 网络接口卡
NPU Neural Processing Unit 神经网络处理器
NVRAM Non-Volatile RAM 非易失性内存
PCIe Peripheral Component Interconnect Express 高速外围组件互联
PEFT Parameter-Efficient Fine-Tuning 参数高效微调
PCIe PCI Express PCIe 总线标准
PFS Parallel File System 并行文件系统
PUE Power Usage Effectiveness 数据中心能效比
QLoRA Quantized Low-Rank Adaptation 量化低秩适配
QPS Queries Per Second 每秒查询数
RAG Retrieval-Augmented Generation 检索增强生成
RDMA Remote Direct Memory Access 远程直接内存访问
ReLU Rectified Linear Unit 修正线性单元
RNN Recurrent Neural Network 循环神经网络
RoCE RDMA over Converged Ethernet 以太网上的 RDMA
RoPE Rotary Position Embedding 旋转位置编码
RPC Remote Procedure Call 远程过程调用
SFT Supervised Fine-Tuning 监督微调
SLO Service Level Objective 服务等级目标
SM Streaming Multiprocessor 流式多处理器(GPU 架构术语)
SPMD Single Program Multiple Data 单程序多数据
SSM State Space Model 状态空间模型
SSD Solid State Drive 固态硬盘
TCO Total Cost of Ownership 总拥有成本
TP Tensor Parallelism 张量并行
TPOT Time Per Output Token 每输出 Token 时间
TPU Tensor Processing Unit 张量处理器(Google)
TTFT Time To First Token 首 Token 延迟
VLM Vision Language Model 视觉语言模型
vLLM Very Large Language Model serving 超大语言模型服务
WSE Wafer-Scale Engine 晶圆级引擎(Cerebras)
XLA Accelerated Linear Algebra 加速线性代数编译器
ZeRO Zero Redundancy Optimizer 零冗余优化器

D.3 常见名词解释

并行策略术语

数据并行(Data Parallelism, DP) 每个 GPU 持有完整的模型副本,处理不同的数据 batch。反向传播后通过 All-Reduce 同步梯度。最简单但内存效率最低。

张量并行(Tensor Parallelism, TP) 将模型的权重矩阵切分到多个 GPU 上。每个 GPU 只持有部分权重。前向和反向需要额外的通信(All-Gather / Reduce-Scatter)。Megatron-LM 的核心策略。

流水线并行(Pipeline Parallelism, PP) 将模型按层分到不同 GPU。GPU 0 处理前几层,GPU 1 处理中间层,以此类推。形成类似工厂流水线的执行模式。主要问题是”气泡”——某些 GPU 在等待前序完成。

3D 并行 同时使用 DP + TP + PP。这是当前训练千亿参数模型的标准方案。

graph TB
    subgraph "3D 并行示意图"
        subgraph "Pipeline Stage 0"
            TP0_DP0[TP Rank 0<br/>DP Rank 0]
            TP1_DP0[TP Rank 1<br/>DP Rank 0]
            TP0_DP1[TP Rank 0<br/>DP Rank 1]
            TP1_DP1[TP Rank 1<br/>DP Rank 1]
        end
        subgraph "Pipeline Stage 1"
            TP0_DP0b[TP Rank 0<br/>DP Rank 0]
            TP1_DP0b[TP Rank 1<br/>DP Rank 0]
            TP0_DP1b[TP Rank 0<br/>DP Rank 1]
            TP1_DP1b[TP Rank 1<br/>DP Rank 1]
        end
        TP0_DP0 -->|前向| TP0_DP0b
        TP1_DP0 -->|前向| TP1_DP0b
        TP0_DP1 -->|前向| TP0_DP1b
        TP1_DP1 -->|前向| TP1_DP1b
        TP0_DP0 <-.-> |All-Reduce| TP1_DP0
        TP0_DP1 <-.-> |All-Reduce| TP1_DP1
    end

量化术语

PTQ(Post-Training Quantization) 训练后量化。不修改训练过程,直接将已训练模型的权重从 FP16 降到 INT8/INT4。简单快速,但可能有精度损失。

QAT(Quantization-Aware Training) 量化感知训练。在训练过程中模拟量化效果,让模型适应低精度。精度更好但需要重新训练。

Weight-Only Quantization 只量化权重,激活保持高精度。推理时将权重反量化后参与计算。适用于内存受限场景。

Weight-Activation Quantization 权重和激活都量化。更激进但需要处理激活的异常值。

推理优化术语

Prefill vs Decode 推理的两个阶段。Prefill 处理输入 prompt(计算密集型),Decode 逐 token 生成(内存密集型)。两者的优化策略完全不同。

KV Cache 存储每个 token 在每层的 Key 和 Value 向量。避免了重复计算历史 token 的注意力。代价是内存消耗线性增长。

PagedAttention 受操作系统虚拟内存启发,将 KV Cache 分成固定大小的”页”,按需分配。解决了 KV Cache 的碎片化问题。vLLM 的核心技术。

Continuous Batching 在 Decode 阶段动态加入新请求、移除已完成请求。避免了静态批处理中因长请求拖慢整体的问题。

Speculative Decoding 用一个小模型快速生成多个候选 token,然后用大模型并行验证。如果小模型的预测正确,就跳过了大模型的逐步生成。适合延迟敏感场景。

网络术语

InfiniBand (IB) 高性能计算专用网络协议。延迟低(< 1μs)、带宽高(400 Gb/s)。数据中心 GPU 训练的标准配置。

RoCE (RDMA over Converged Ethernet) 在标准以太网上实现 RDMA。成本低于 IB,但性能略有损失。

NVLink NVIDIA GPU 之间的专用高速互联。带宽远高于 PCIe(NVLink 4.0: 900 GB/s vs PCIe 5.0: 128 GB/s)。

Fat-Tree Topology 胖树拓扑。一种数据中心网络拓扑,保证任意两个节点之间有等价的多条路径。GPU 集群的常见选择。

存储术语

PFS(Parallel File System) 并行文件系统。将数据分散到多个存储节点上,支持多个客户端同时高速读写。训练大数据集的必需品。

常见 PFS 选择: - Lustre: HPC 场景的主流选择,性能极高 - GPFS (IBM): 商业方案,稳定性好 - WekaFS: AI 场景优化的现代 PFS - JuiceFS: 开源方案,基于对象存储

硬件术语

HBM (High Bandwidth Memory) 高带宽内存。通过 3D 堆叠和宽接口提供极高带宽(HBM3: 3 TB/s)。是 GPU 性能的关键瓶颈之一。

TDP (Thermal Design Power) 热设计功耗。芯片在最大负载下的功耗。H100 的 TDP 为 700W,B200 达 1200W。

PUE (Power Usage Effectiveness) 数据中心能效比。PUE = 总能耗 / IT 设备能耗。理想值接近 1.0。传统数据中心约 1.5,液冷数据中心可达 1.05-1.2。

小结

术语表不是用来一次读完的,而是在遇到不确定的术语时回来查阅。几点使用建议:

  1. 中英文混用是常态——在中文技术讨论中,很多术语直接用英文更准确(如 KV Cache、All-Reduce、checkpoint)。
  2. 缩写一定要记全称——只知道 NCCL 是缩写没用,知道是”NVIDIA Collective Communications Library”才能理解它的功能。
  3. 术语的语境很重要——“推理”在 ML 语境下是 inference,在逻辑学语境下是 reasoning。根据上下文判断。

延伸阅读

  • Hugging Face Glossary: https://huggingface.co/learn/nlp-course/chapter1/2 (ML 术语)
  • NVIDIA Glossary: GPU 和计算相关术语
  • Cloud Native Glossary: https://glossary.cncf.io/ (K8s 和云原生术语)
  • IEEE Standards Dictionary: 正式的技术术语定义