AI Infra 系统设计
从训练到推理的规模化实践
本书面向 AI 系统工程师、基础设施架构师、算法工程化从业者, 系统讲解从底层硬件到上层平台的大规模 AI 基础设施设计方法。
欢迎阅读


“Infrastructure is not just plumbing — it is the foundation upon which intelligence scales.”
本书面向 AI 系统工程师、基础设施架构师、算法工程化从业者,系统讲解从底层硬件到上层平台的大规模 AI 基础设施设计方法。
本书适合谁
- AI 系统工程师 — 负责训练和推理平台搭建与优化
- 基础设施架构师 — 设计和管理 GPU 集群、存储和网络
- 算法工程化从业者 — 需要将模型从实验环境推向生产
- 技术管理者 — 理解 AI 基础设施的成本、能力和限制
- 计算机专业学生 — 希望进入 AI 系统方向
如何阅读本书
本书采用自底向上的组织方式:
- 第一部分(基础与背景) 建立对 AI 基础设施的全景认知
- 第二部分(训练系统) 深入分布式训练的工程实践
- 第三部分(推理系统) 聚焦模型服务与优化技术
- 第四至五部分(数据/MLOps) 覆盖平台工程和运维
- 第六部分(进阶专题) 探讨超大规模和前沿挑战
- 第七部分(开源实践) 拆解主流开源模型的训推技术
- 第八部分(案例与未来) 业界实践和发展趋势
建议第一遍按顺序阅读第一至三部分,建立核心知识框架后,再根据兴趣跳读其他章节。