🚀 第八篇:Post-Training 与相邻 AI Infra (Adjacent Workloads & Heterogeneous Computing)
讲师 / 作者:👓 Ringi(大厂 AI Infrastructure 工程师)
模块定位:选修 | 建议时长:12h
核心目标:理解 SFT/RLHF、RAG/Agent 基础设施、NPU/DPU 异构硬件对底层 Infra 的系统需求。
🎯 模块设计理念与工程师视角
在这一模块中,我们将坚持 Ringi 三问教学协议:- 📐 Shape 是什么?(Tensor 形状在每一步算子中到底怎么流转?有哪些 Reshape/Broadcast/Reduction?)
- 💰 钱花在哪里?(估算参数量、FLOPs、显存占用、通信量,明确判断 Compute-bound、Memory-bound 还是 Communication-bound?)
- ⚙️ 真正在机器上怎么跑?(在 GPU 的 SM、HBM、SRAM、PCIe/NVLink、NCCL 上对应什么具体指令和 Kernel?)
📑 本模块章节目录与实战任务
🛠️ 推荐实验与检验标准
- 完成本模块对应的手算推导与代码验证。
- 能结合 Profiler(PyTorch Profiler / Nsight / nccl-tests)给出定量性能证据。
- 能够回答本模块对应的经典大厂面试题与故障诊断题。
返回主目录:《Ringi AI Infra 学习体系全景地图》