Skip to main content

🚀 第五篇:大模型大规模分布式训练系统 (Distributed Training Systems)

讲师 / 作者:👓 Ringi(大厂 AI Infrastructure 工程师)
模块定位:必修 | 建议时长:16h
核心目标:掌握 DDP、FSDP、ZeRO-1/2/3、TP、PP、SP、CP、MoE 及 3D 混合并行训练体系与故障复盘。

🎯 模块设计理念与工程师视角

在这一模块中,我们将坚持 Ringi 三问教学协议:
  1. 📐 Shape 是什么?(Tensor 形状在每一步算子中到底怎么流转?有哪些 Reshape/Broadcast/Reduction?)
  2. 💰 钱花在哪里?(估算参数量、FLOPs、显存占用、通信量,明确判断 Compute-bound、Memory-bound 还是 Communication-bound?)
  3. ⚙️ 真正在机器上怎么跑?(在 GPU 的 SM、HBM、SRAM、PCIe/NVLink、NCCL 上对应什么具体指令和 Kernel?)

📑 本模块章节目录与实战任务


🛠️ 推荐实验与检验标准

  • 完成本模块对应的手算推导与代码验证。
  • 能结合 Profiler(PyTorch Profiler / Nsight / nccl-tests)给出定量性能证据。
  • 能够回答本模块对应的经典大厂面试题与故障诊断题。

返回主目录:《Ringi AI Infra 学习体系全景地图》