Skip to main content

🚀 第三篇:CUDA 编程与高性能算子优化 (CUDA & Operator Performance Engineering)

讲师 / 作者:👓 Ringi(大厂 AI Infrastructure 工程师)
模块定位:必修 | 建议时长:16h
核心目标:从线程层次模型到 Softmax/GEMM/FlashAttention 算子手写与极致优化。

🎯 模块设计理念与工程师视角

在这一模块中,我们将坚持 Ringi 三问教学协议:
  1. 📐 Shape 是什么?(Tensor 形状在每一步算子中到底怎么流转?有哪些 Reshape/Broadcast/Reduction?)
  2. 💰 钱花在哪里?(估算参数量、FLOPs、显存占用、通信量,明确判断 Compute-bound、Memory-bound 还是 Communication-bound?)
  3. ⚙️ 真正在机器上怎么跑?(在 GPU 的 SM、HBM、SRAM、PCIe/NVLink、NCCL 上对应什么具体指令和 Kernel?)

📑 本模块章节目录与实战任务


🛠️ 推荐实验与检验标准

  • 完成本模块对应的手算推导与代码验证。
  • 能结合 Profiler(PyTorch Profiler / Nsight / nccl-tests)给出定量性能证据。
  • 能够回答本模块对应的经典大厂面试题与故障诊断题。

返回主目录:《Ringi AI Infra 学习体系全景地图》