🚀 第三篇:CUDA 编程与高性能算子优化 (CUDA & Operator Performance Engineering)
讲师 / 作者:👓 Ringi(大厂 AI Infrastructure 工程师)
模块定位:必修 | 建议时长:16h
核心目标:从线程层次模型到 Softmax/GEMM/FlashAttention 算子手写与极致优化。
🎯 模块设计理念与工程师视角
在这一模块中,我们将坚持 Ringi 三问教学协议:- 📐 Shape 是什么?(Tensor 形状在每一步算子中到底怎么流转?有哪些 Reshape/Broadcast/Reduction?)
- 💰 钱花在哪里?(估算参数量、FLOPs、显存占用、通信量,明确判断 Compute-bound、Memory-bound 还是 Communication-bound?)
- ⚙️ 真正在机器上怎么跑?(在 GPU 的 SM、HBM、SRAM、PCIe/NVLink、NCCL 上对应什么具体指令和 Kernel?)
📑 本模块章节目录与实战任务
🛠️ 推荐实验与检验标准
- 完成本模块对应的手算推导与代码验证。
- 能结合 Profiler(PyTorch Profiler / Nsight / nccl-tests)给出定量性能证据。
- 能够回答本模块对应的经典大厂面试题与故障诊断题。
返回主目录:《Ringi AI Infra 学习体系全景地图》