前言

前言

为什么要写这本书

2024 年到 2026 年,AI 行业经历了一场前所未有的基础设施革命。当一个大语言模型的参数量从数十亿增长到数千亿,当训练集群从单机八卡扩展到万卡规模,当推理服务需要每天处理数十亿条请求——传统的软件工程方法论已经不够用了。

AI 基础设施(AI Infra) 作为一门独立的工程学科,正是在这种张力中诞生的。它融合了分布式系统、高性能计算、存储工程、网络工程和机器学习工程等多个领域的知识,形成了一套独特的方法论和实践体系。

然而,这个领域缺少一本系统性的教材。

我在构建自己的 AI 平台时,深刻体会到这个问题。每当遇到一个新的工程挑战——是选择数据并行还是张量并行?Checkpoint 应该多频繁?推理服务的 KV Cache 应该如何配置?——都需要翻阅大量论文、博客和源代码,拼凑出答案。这个过程既低效又容易出错。

本书就是我期望在两年前就能读到的那本书。

本书的目标

本书不是一本论文综述,也不是一本工具手册。它的目标是:

  1. 建立系统性认知 — 帮助读者理解 AI 基础设施的全景和各组件之间的关系
  2. 提供工程方法论 — 不仅是”是什么”,更要讲清楚”为什么”和”怎么做”
  3. 连接理论与实践 — 每个概念都配以真实的工程案例和代码示例
  4. 覆盖最新进展 — 包括 2025-2026 年的最新技术,如 FP8 训练、MoE 推理、投机采样等

与其他书的关系

本书受到了 Chip Huyen 所著《AI Engineering》的深刻影响。那本书出色地涵盖了 AI 工程化的上层问题——数据工程、模型开发、部署和监控。本书则专注于其下层的基础设施层面:硬件如何组织、训练如何并行、推理如何优化、集群如何调度。

两本书互补而不重叠。如果你将《AI Engineering》视为 AI 工程的”应用层”指南,那么本书就是”系统层”指南。

本书的风格

我尽力做到以下几点:

  • 务实 — 优先讲实践中用得到的知识,而非学术上的完整性
  • 有观点 — 在有经验积累的地方,给出明确的技术选型建议
  • 可操作 — 提供足够的代码和配置示例,让读者能直接上手
  • 可追问 — 每一章末尾提供延伸阅读,满足想深入了解的读者

勘误与反馈

书中难免有错误和遗漏。欢迎通过以下方式反馈:

致谢

感谢所有在 AI 基础设施领域开源代码、分享经验、撰写论文和博客的工程师与研究者。这本书站在你们的肩膀上。


“If I have seen further, it is by standing on the shoulders of giants.” — Isaac Newton