graph TB
subgraph "3D 并行示意图"
subgraph "Pipeline Stage 0"
TP0_DP0[TP Rank 0<br/>DP Rank 0]
TP1_DP0[TP Rank 1<br/>DP Rank 0]
TP0_DP1[TP Rank 0<br/>DP Rank 1]
TP1_DP1[TP Rank 1<br/>DP Rank 1]
end
subgraph "Pipeline Stage 1"
TP0_DP0b[TP Rank 0<br/>DP Rank 0]
TP1_DP0b[TP Rank 1<br/>DP Rank 0]
TP0_DP1b[TP Rank 0<br/>DP Rank 1]
TP1_DP1b[TP Rank 1<br/>DP Rank 1]
end
TP0_DP0 -->|前向| TP0_DP0b
TP1_DP0 -->|前向| TP1_DP0b
TP0_DP1 -->|前向| TP0_DP1b
TP1_DP1 -->|前向| TP1_DP1b
TP0_DP0 <-.-> |All-Reduce| TP1_DP0
TP0_DP1 <-.-> |All-Reduce| TP1_DP1
end
附录D 术语表
附录D 术语表
AI Infra 领域的术语和缩写极多。这份术语表收录了本书中出现的关键术语,按字母顺序排列。
D.1 中英文对照术语表
A
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Activation Checkpointing | 激活检查点 | 训练中用重计算换内存的技术 |
| Adapter | 适配器 | 插入到预训练模型中的小型可训练模块 |
| All-Gather | 全收集 | 分布式通信原语,所有节点收集所有数据 |
| All-Reduce | 全规约 | 分布式通信原语,所有节点聚合结果 |
| Attention | 注意力(机制) | Transformer 的核心计算模块 |
| Auto-regressive | 自回归 | 逐 token 生成文本的方式 |
| AWQ | 激活感知权重量化 | 一种 4-bit 量化方法 |
B
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Backpropagation | 反向传播 | 计算梯度的标准算法 |
| Batch Size | 批大小 | 一次前向/反向处理的样本数 |
| Beam Search | 束搜索 | 生成时维护多个候选序列的解码策略 |
| BF16 (Bfloat16) | 脑浮点16 | Google 推出的 16 位浮点格式,动态范围大 |
| Byte-Pair Encoding (BPE) | 字节对编码 | 最常用的子词分词算法 |
C
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Cache | 缓存 | 存储中间结果以加速后续计算 |
| Checkpoint | 检查点 | 训练中保存的模型状态快照 |
| Chinchilla Scaling Laws | Chinchilla 缩放定律 | 模型参数和训练数据的最优配比(约 20:1) |
| Chunked Prefill | 分块预填充 | 将长 prompt 的 prefill 拆分成块处理 |
| Continuous Batching | 连续批处理 | 动态调整 batch 中的请求,提高吞吐 |
| CUDA | CUDA | NVIDIA 的 GPU 并行计算平台 |
D
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Data Parallelism | 数据并行 | 将数据分到不同 GPU,每 GPU 有完整模型副本 |
| Decoder | 解码器 | Transformer 中负责生成的部分 |
| DeepSpeed | DeepSpeed | 微软开发的分布式训练框架 |
| Distillation | 蒸馏 | 用大模型训练小模型的技术 |
| Distributed Training | 分布式训练 | 多 GPU/多机协同训练 |
E
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Embedding | 嵌入/向量化 | 将离散 token 映射为连续向量 |
| Encoder | 编码器 | Transformer 中负责理解输入的部分 |
| Expert | 专家 | MoE 架构中的子网络 |
| Expert Parallelism | 专家并行 | 将 MoE 的不同 expert 放在不同 GPU 上 |
F
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Fine-tuning | 微调 | 在预训练模型上继续训练 |
| FlashAttention | 闪速注意力 | IO-aware 的注意力优化算法 |
| FLOPS | 每秒浮点运算次数 | 衡量计算性能的单位 |
| FP16 | 半精度浮点 | 16 位浮点格式 |
| FP8 | 8 位浮点 | 最新的低精度训练/推理格式 |
| FP4 | 4 位浮点 | 极低精度格式(Blackwell 支持) |
| FSDP | 完全分片数据并行 | PyTorch 的 ZeRO-3 等价方案 |
| Fusion | 算子融合 | 将多个小 kernel 合并为一个大 kernel |
G
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Generation | 生成 | 模型输出文本/图像的过程 |
| Goodput | 有效吞吐量 | 满足 SLO 的请求吞吐量 |
| GPUDirect RDMA | GPU 直接远程内存访问 | GPU 之间直接通信,不经过 CPU |
| Gradient Accumulation | 梯度累积 | 多次小 batch 的梯度累加后再更新 |
| Gradient Checkpointing | 梯度检查点 | 同激活检查点 |
| GPTQ | GPT 量化 | 一种训练后权重量化方法 |
| Group Query Attention (GQA) | 分组查询注意力 | 多个 query 共享 key/value head |
H
| 英文 | 中文 | 简要说明 |
|---|---|---|
| HBM | 高带宽内存 | GPU 上的高带宽显存 |
| HFU | 硬件 FLOPS 利用率 | 含重计算的实际硬件利用率 |
| Hidden Size | 隐藏维度 | Transformer 中间表示的维度 |
I
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Inference | 推理 | 使用训练好的模型生成结果 |
| InfiniBand | 无限带宽 | 高性能计算网络标准 |
| INT8 | 8 位整数 | 量化格式之一 |
| KV Cache | KV 缓存 | 存储已计算的 Key/Value 以避免重复计算 |
K
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Kernel | 核函数/计算核 | GPU 上执行的基本计算单元 |
| Key-Value Cache | 键值缓存 | 同 KV Cache |
| KV Cache Compression | KV 缓存压缩 | 减少 KV Cache 内存占用的技术 |
L
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Layer | 层 | 神经网络的基本组成单元 |
| Learning Rate | 学习率 | 控制参数更新步长 |
| LoRA | 低秩适配 | 在冻结权重上添加低秩矩阵的微调方法 |
| LoRA | 低秩适配器 | 参数高效微调的主流方法 |
M
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Megatron-LM | Megatron-LM | NVIDIA 的大模型训练框架 |
| Memory Bandwidth | 内存带宽 | 数据从显存到计算单元的传输速率 |
| MFU | 模型 FLOPS 利用率 | 实际计算量与理论峰值之比 |
| Mixture of Experts (MoE) | 混合专家模型 | 每次只激活部分专家的稀疏模型架构 |
| MLOps | 机器学习运维 | ML 系统的开发和运维实践 |
| Model Parallelism | 模型并行 | 将模型分到不同 GPU 上 |
| Multi-Head Attention (MHA) | 多头注意力 | 多个注意力头并行计算 |
| Multi-Query Attention (MQA) | 多查询注意力 | 多个 query 共享一组 key/value |
N
| 英文 | 中文 | 简要说明 |
|---|---|---|
| NCCL | NVIDIA 集合通信库 | GPU 间高性能通信库 |
| Next-Token Prediction | 下一 token 预测 | 语言模型的核心训练目标 |
| NPU | 神经网络处理器 | 专用 AI 加速芯片(如华为昇腾) |
| NVLink | NVLink | NVIDIA GPU 间的高速互联 |
O
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Operator Fusion | 算子融合 | 将多个操作合并为一个 |
| Over-subscription | 超额订阅 | 分配的资源超过物理资源总量 |
P
| 英文 | 中文 | 简要说明 |
|---|---|---|
| PagedAttention | 分页注意力 | vLLM 提出的 KV Cache 分页管理方案 |
| Pipeline Parallelism | 流水线并行 | 将模型按层分到不同 GPU,形成流水线 |
| Pipeline Bubble | 流水线气泡 | 流水线并行中的空闲时间 |
| PUE | 数据中心能效比 | 数据中心总能耗与 IT 设备能耗之比 |
| Prefill | 预填充 | 处理输入 prompt 生成 KV Cache 的阶段 |
| Prefix Caching | 前缀缓存 | 缓存公共 prompt 的 KV Cache |
Q
| 英文 | 中文 | 简要说明 |
|---|---|---|
| QLoRA | 量化低秩适配 | 对量化模型做 LoRA 微调 |
| Quantization | 量化 | 降低模型参数精度以减少内存和计算 |
R
| 英文 | 中文 | 简要说明 |
|---|---|---|
| RDMA | 远程直接内存访问 | 不经过 CPU 的网络数据传输 |
| Reasoning | 推理/推理 | 模型的推理过程(注意与 Inference 区分语境) |
| Recomputation | 重计算 | 丢弃中间激活,需要时重新计算 |
| Reduce-Scatter | 规约分散 | 分布式通信原语 |
| RLHF | 人类反馈强化学习 | 用人类偏好训练模型对齐 |
| Ring Attention | 环形注意力 | 跨 GPU 分块计算超长序列的注意力 |
| RoCE | 融合以太网上的 RDMA | 在标准以太网上实现 RDMA |
| RoPE | 旋转位置编码 | 主流的位置编码方式 |
S
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Scheduler | 调度器 | 决定何时执行哪个任务 |
| Sequence Length | 序列长度 | 输入/输出的 token 数 |
| Sharding | 分片 | 将数据/参数分布到多个设备 |
| Speculative Decoding | 推测解码 | 用小模型预测 + 大模型验证的加速方法 |
| SLO | 服务等级目标 | 对外承诺的性能指标 |
| State Space Model (SSM) | 状态空间模型 | Transformer 的替代架构 |
| Streaming | 流式 | 逐 token 返回结果的生成方式 |
T
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Tensor | 张量 | 多维数组,深度学习的基本数据结构 |
| Tensor Core | 张量核心 | GPU 中专门执行矩阵乘法的单元 |
| Tensor Parallelism | 张量并行 | 将单个矩阵运算分到多 GPU |
| TensorRT-LLM | TensorRT-LLM | NVIDIA 的 LLM 推理优化引擎 |
| Throughput | 吞吐量 | 单位时间处理的请求数/token 数 |
| Token | 词元 | 模型处理的最小文本单位 |
| Tokenization | 分词 | 将文本分割为 token 的过程 |
| TPOT | 每输出 Token 延迟 | 生成每个 token 的平均时间 |
| Training | 训练 | 调整模型参数的过程 |
V
| 英文 | 中文 | 简要说明 |
|---|---|---|
| vLLM | vLLM | 最流行的开源 LLM 推理引擎 |
| Vector Database | 向量数据库 | 存储和检索向量嵌入的专用数据库 |
W
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Wall-clock Time | 实际运行时间 | 从开始到结束经过的真实时间 |
| Weight | 权重 | 模型的可学习参数 |
Z
| 英文 | 中文 | 简要说明 |
|---|---|---|
| Zero Redundancy Optimizer (ZeRO) | 零冗余优化器 | DeepSpeed 的核心优化方案 |
| Zero-shot | 零样本 | 不给示例直接要求模型完成任务 |
D.2 缩写全称对照表
| 缩写 | 全称 | 中文含义 |
|---|---|---|
| BF16 | Brain Floating Point 16-bit | 16位脑浮点数 |
| BPE | Byte-Pair Encoding | 字节对编码 |
| CAS | Compare-And-Swap | 比较并交换(原子操作) |
| CLI | Command Line Interface | 命令行界面 |
| CPO | Co-Packaged Optics | 共封装光学 |
| CUDA | Compute Unified Device Architecture | 统一计算设备架构 |
| DCLM | Data Compartment Language Model | 数据隔离语言模型 |
| DDP | DistributedDataParallel | 分布式数据并行 |
| DLC | Direct Liquid Cooling | 直接液体冷却 |
| DPO | Direct Preference Optimization | 直接偏好优化 |
| FFT | Fast Fourier Transform | 快速傅里叶变换 |
| FP | Floating Point | 浮点数 |
| FSDP | Fully Sharded Data Parallel | 完全分片数据并行 |
| FT | Fine-Tuning | 微调 |
| GQA | Grouped Query Attention | 分组查询注意力 |
| HFU | Hardware FLOPS Utilization | 硬件 FLOPS 利用率 |
| HBM | High Bandwidth Memory | 高带宽内存 |
| IB | InfiniBand | 无限带宽网络 |
| I/O | Input/Output | 输入/输出 |
| KV | Key-Value | 键值对 |
| LoRA | Low-Rank Adaptation | 低秩适配 |
| MAU | Monthly Active Users | 月活跃用户 |
| MFU | Model FLOPS Utilization | 模型 FLOPS 利用率 |
| MHA | Multi-Head Attention | 多头注意力 |
| MLA | Multi-head Latent Attention | 多头潜在注意力(DeepSeek) |
| MoE | Mixture of Experts | 混合专家 |
| MQA | Multi-Query Attention | 多查询注意力 |
| NCCL | NVIDIA Collective Communications Library | NVIDIA 集合通信库 |
| NIC | Network Interface Card | 网络接口卡 |
| NPU | Neural Processing Unit | 神经网络处理器 |
| NVRAM | Non-Volatile RAM | 非易失性内存 |
| PCIe | Peripheral Component Interconnect Express | 高速外围组件互联 |
| PEFT | Parameter-Efficient Fine-Tuning | 参数高效微调 |
| PCIe | PCI Express | PCIe 总线标准 |
| PFS | Parallel File System | 并行文件系统 |
| PUE | Power Usage Effectiveness | 数据中心能效比 |
| QLoRA | Quantized Low-Rank Adaptation | 量化低秩适配 |
| QPS | Queries Per Second | 每秒查询数 |
| RAG | Retrieval-Augmented Generation | 检索增强生成 |
| RDMA | Remote Direct Memory Access | 远程直接内存访问 |
| ReLU | Rectified Linear Unit | 修正线性单元 |
| RNN | Recurrent Neural Network | 循环神经网络 |
| RoCE | RDMA over Converged Ethernet | 以太网上的 RDMA |
| RoPE | Rotary Position Embedding | 旋转位置编码 |
| RPC | Remote Procedure Call | 远程过程调用 |
| SFT | Supervised Fine-Tuning | 监督微调 |
| SLO | Service Level Objective | 服务等级目标 |
| SM | Streaming Multiprocessor | 流式多处理器(GPU 架构术语) |
| SPMD | Single Program Multiple Data | 单程序多数据 |
| SSM | State Space Model | 状态空间模型 |
| SSD | Solid State Drive | 固态硬盘 |
| TCO | Total Cost of Ownership | 总拥有成本 |
| TP | Tensor Parallelism | 张量并行 |
| TPOT | Time Per Output Token | 每输出 Token 时间 |
| TPU | Tensor Processing Unit | 张量处理器(Google) |
| TTFT | Time To First Token | 首 Token 延迟 |
| VLM | Vision Language Model | 视觉语言模型 |
| vLLM | Very Large Language Model serving | 超大语言模型服务 |
| WSE | Wafer-Scale Engine | 晶圆级引擎(Cerebras) |
| XLA | Accelerated Linear Algebra | 加速线性代数编译器 |
| ZeRO | Zero Redundancy Optimizer | 零冗余优化器 |
D.3 常见名词解释
并行策略术语
数据并行(Data Parallelism, DP) 每个 GPU 持有完整的模型副本,处理不同的数据 batch。反向传播后通过 All-Reduce 同步梯度。最简单但内存效率最低。
张量并行(Tensor Parallelism, TP) 将模型的权重矩阵切分到多个 GPU 上。每个 GPU 只持有部分权重。前向和反向需要额外的通信(All-Gather / Reduce-Scatter)。Megatron-LM 的核心策略。
流水线并行(Pipeline Parallelism, PP) 将模型按层分到不同 GPU。GPU 0 处理前几层,GPU 1 处理中间层,以此类推。形成类似工厂流水线的执行模式。主要问题是”气泡”——某些 GPU 在等待前序完成。
3D 并行 同时使用 DP + TP + PP。这是当前训练千亿参数模型的标准方案。
量化术语
PTQ(Post-Training Quantization) 训练后量化。不修改训练过程,直接将已训练模型的权重从 FP16 降到 INT8/INT4。简单快速,但可能有精度损失。
QAT(Quantization-Aware Training) 量化感知训练。在训练过程中模拟量化效果,让模型适应低精度。精度更好但需要重新训练。
Weight-Only Quantization 只量化权重,激活保持高精度。推理时将权重反量化后参与计算。适用于内存受限场景。
Weight-Activation Quantization 权重和激活都量化。更激进但需要处理激活的异常值。
推理优化术语
Prefill vs Decode 推理的两个阶段。Prefill 处理输入 prompt(计算密集型),Decode 逐 token 生成(内存密集型)。两者的优化策略完全不同。
KV Cache 存储每个 token 在每层的 Key 和 Value 向量。避免了重复计算历史 token 的注意力。代价是内存消耗线性增长。
PagedAttention 受操作系统虚拟内存启发,将 KV Cache 分成固定大小的”页”,按需分配。解决了 KV Cache 的碎片化问题。vLLM 的核心技术。
Continuous Batching 在 Decode 阶段动态加入新请求、移除已完成请求。避免了静态批处理中因长请求拖慢整体的问题。
Speculative Decoding 用一个小模型快速生成多个候选 token,然后用大模型并行验证。如果小模型的预测正确,就跳过了大模型的逐步生成。适合延迟敏感场景。
网络术语
InfiniBand (IB) 高性能计算专用网络协议。延迟低(< 1μs)、带宽高(400 Gb/s)。数据中心 GPU 训练的标准配置。
RoCE (RDMA over Converged Ethernet) 在标准以太网上实现 RDMA。成本低于 IB,但性能略有损失。
NVLink NVIDIA GPU 之间的专用高速互联。带宽远高于 PCIe(NVLink 4.0: 900 GB/s vs PCIe 5.0: 128 GB/s)。
Fat-Tree Topology 胖树拓扑。一种数据中心网络拓扑,保证任意两个节点之间有等价的多条路径。GPU 集群的常见选择。
存储术语
PFS(Parallel File System) 并行文件系统。将数据分散到多个存储节点上,支持多个客户端同时高速读写。训练大数据集的必需品。
常见 PFS 选择: - Lustre: HPC 场景的主流选择,性能极高 - GPFS (IBM): 商业方案,稳定性好 - WekaFS: AI 场景优化的现代 PFS - JuiceFS: 开源方案,基于对象存储
硬件术语
HBM (High Bandwidth Memory) 高带宽内存。通过 3D 堆叠和宽接口提供极高带宽(HBM3: 3 TB/s)。是 GPU 性能的关键瓶颈之一。
TDP (Thermal Design Power) 热设计功耗。芯片在最大负载下的功耗。H100 的 TDP 为 700W,B200 达 1200W。
PUE (Power Usage Effectiveness) 数据中心能效比。PUE = 总能耗 / IT 设备能耗。理想值接近 1.0。传统数据中心约 1.5,液冷数据中心可达 1.05-1.2。
小结
术语表不是用来一次读完的,而是在遇到不确定的术语时回来查阅。几点使用建议:
- 中英文混用是常态——在中文技术讨论中,很多术语直接用英文更准确(如 KV Cache、All-Reduce、checkpoint)。
- 缩写一定要记全称——只知道 NCCL 是缩写没用,知道是”NVIDIA Collective Communications Library”才能理解它的功能。
- 术语的语境很重要——“推理”在 ML 语境下是 inference,在逻辑学语境下是 reasoning。根据上下文判断。
延伸阅读
- Hugging Face Glossary: https://huggingface.co/learn/nlp-course/chapter1/2 (ML 术语)
- NVIDIA Glossary: GPU 和计算相关术语
- Cloud Native Glossary: https://glossary.cncf.io/ (K8s 和云原生术语)
- IEEE Standards Dictionary: 正式的技术术语定义