# AI Infra 大话西游之水滴石穿 - [AI Infra 大话西游之水滴石穿](https://lilinji.mintlify.app/index.md): 从基础设施到智能未来的工程哲学与实战指南:涵盖从底层物理硅基、编译算子到万卡超算调度中枢的完整 8 层工业级 AI Infra 技术栈。 - [Documentation Style Guide](https://lilinji.mintlify.app/style-guide.md): This document is the editorial source of truth for all documentation prose, headings, and structure. - [Content Types (Diátaxis Model)](https://lilinji.mintlify.app/content-types.md): This document outlines the four documentation content types and their execution criteria. - [🚀 第一篇:性能工程与系统前置基石 (Performance Engineering & Systems Baseline)](https://lilinji.mintlify.app/01_性能工程与系统前置/README.md): 系统学习 🚀 第一篇:性能工程与系统前置基石 (Performance Engineering & Systems Baseline) 的核心技术原理与工业级落地实战。 - [第01讲:AI Infra 工程师的 C++ 与 Python 底层必修课](https://lilinji.mintlify.app/01_性能工程与系统前置/01_AI_Infra工程师的C++与Python底层必修课.md): 掌握 AI Infra 开发所需的物理内存模型、RAII 显存生命周期、std::move 零拷贝、PyBind11 跨语言桥接与 PyTorch ATen C++ 扩展开发实战。 - [第02讲:AI Infra 数学第一性原理:从张量物理寻址、GEMM 算力账本到自动微分与数值防爆](https://lilinji.mintlify.app/01_性能工程与系统前置/02_AI_Infra数学基础.md): 以第一性原理拆解 AI Infra 数学底座:张量物理 Strides、GEMM 分块算术强度、反向 2 次 GEMM 推导、Stable Softmax 数值防爆与混合精度底层机制。 - [第03讲:计算机体系结构前置:CPU 存储层次、Cache Line 与 NUMA 架构](https://lilinji.mintlify.app/01_性能工程与系统前置/03_计算机体系结构前置_CPU存储层次_CacheLine与NUMA架构.md): 从 CPU 存储层次(L1/L2/L3/DRAM)、64 字节 Cache Line 伪共享、内存对齐到 NUMA 跨插槽拓扑对齐与 Pinned Memory 锁页内存,彻底打破 GPU 算力饥饿与数据加载瓶颈。 - [第04讲:Linux 系统基线与性能分析核心工具箱](https://lilinji.mintlify.app/01_性能工程与系统前置/04_Linux系统基线与性能分析核心工具箱.md): 从 Linux 进程线程内核模型、D 状态不可中断睡眠死锁、四大黄金资源基线(top/vmstat/iostat/sar)、USE 性能方法论,到 perf 硬件 PMU 计数器与 On-CPU / Off-CPU 火焰图实战,彻底打通 AI 基础设施的操作系统观测与排障底座。 - [第05讲:PyTorch 底层系统机制:Tensor 内存布局、Stride 与 Contiguous](https://lilinji.mintlify.app/01_性能工程与系统前置/05_PyTorch底层系统机制_Tensor内存布局_Stride与Contiguous.md): 深入剖析 PyTorch Tensor Storage 物理底账、Strides 步长投影、零拷贝视图(View/Transpose/Permute)与 is_contiguous 避坑指南,从底层 C10/ATen 源码到 GPU 内存合并访问(Memory Coalescing)全景打通。 - [第06讲:PyTorch 计算图与 Autograd 显存生命周期:动态 DAG、反向求导机制与 Activation 显存优化](https://lilinji.mintlify.app/01_性能工程与系统前置/06_PyTorch计算图与Autograd显存生命周期.md): 深入剖析 PyTorch 动态计算图(DAG)底层构建机制、C++ Autograd 引擎(Node/Edge/SavedVariable)、Forward 与 Backward 显存占用心电图、In-place 版本计数器校验、no_grad 与 inference_mode 差异,以及 Activation Checkpointing 显存换计算第一性原理与工业级系统实战。 - [第07讲:PyTorch 异步执行流:CUDA Stream 与 CUDA Graph 原理](https://lilinji.mintlify.app/01_性能工程与系统前置/07_PyTorch异步执行流_CUDA_Stream与CUDA_Graph原理.md): 深入剖析 GPU 异步执行第一性原理:Host-Device 生产者消费者队列、Default Stream 与多流并发调度、Event 流间同步屏障、record_stream 显存踩踏暗礁、CPU Launch Overhead 瓶颈剖析,以及 CUDA Graph 录制回放与 vLLM 多桶图优化工业级系统实战。 - [第08讲:为什么 Attention 算力没少算,FlashAttention 却能快 3 倍?:从 Decoder Block 算子图、RoPE 复数旋转到显](https://lilinji.mintlify.app/01_性能工程与系统前置/08_Transformer系统全景与算子执行图深度拆解.md): 深入剖析 Transformer 算子执行图与第一性原理:以认知冲突拆解 Self-Attention、FlashAttention 片上 SRAM 算子融合、RoPE 2D 复数几何旋转、SwiGLU 门控、RMSNorm 梯度高速公路与 LLaMA 7B/70B 显存四账本及 PagedAttention 虚拟内存分页实战。 - [第09讲:网络通信基础与集合通信 Collective 原语直觉:从物理网络拓扑到 Ring/Tree 算法与通信量第一性原理](https://lilinji.mintlify.app/01_性能工程与系统前置/09_网络通信基础与集合通信Collective原语直觉.md): 以大众直觉与大厂工程第一性原理拆解分布式网络:从 Gbps/GBps 物理单位换算、P2P 瓶颈、八大集合通信原语(Broadcast/Reduce/AllReduce/AllGather/ReduceScatter/AllToAll),到 Ring-AllReduce 环形流水线、Tree 算法、α-β 通信耗时模型与通信量精确手算,直通 DDP、TP、ZeRO 与 MoE 的生产底层。 - [第10讲:AI Infra 性能工程方法论与三账本:FLOPs、显存与通信](https://lilinji.mintlify.app/01_性能工程与系统前置/10_AI_Infra性能工程方法论与三账本_FLOPs_显存_通信.md): 建立大厂 AI Infra 性能分析第一性原理:以生活直觉与极简小算盘拆解 MFU/HFU/TFLOPS 真实算力指标、2P/6P/8P 浮点计算量账本、静态与动态显存四账本、跨卡通信量账本与 Roofline 算术强度模型,手把手推导 LLaMA-2/3 7B/70B 训练与推理集群资源规划实战。 - [第11讲:GPU 利用率 99% 的卡,为什么训练还是跑不快?:从 Kineto 底层探针、Trace 时间线四重病灶到 PyTorch Profiler 性能](https://lilinji.mintlify.app/01_性能工程与系统前置/11_PyTorch_Profiler实战_手把手带你做一次性能体检.md): 建立大厂 AI Infra 性能诊断第一性原理:以生活直觉与极简小算盘拆穿 GPU 利用率假象,从 Kineto/CUPTI 底层硬件时间戳探针、四阶 Schedule 采集周期、Chrome Trace / Perfetto 时间线四大病灶排障,到 TensorBoard 性能看板与 4 大生产级性能体检实战。 - [🚀 AI Infra 大话西游实战之Transformer小白学习笔记(一)](https://lilinji.mintlify.app/01_性能工程与系统前置/AI Infra 大话西游实战之Transformer小白学习笔记(一).md): 系统学习 🚀 AI Infra 大话西游实战之Transformer小白学习笔记(一) 的核心技术原理与工业级落地实战。 - [🚀 第二篇:GPU 硬件微架构、数据搬运与集群互联 (GPU Architecture & Interconnect)](https://lilinji.mintlify.app/02_GPU硬件与集群互联/README.md): 系统学习 🚀 第二篇:GPU 硬件微架构、数据搬运与集群互联 (GPU Architecture & Interconnect) 的核心技术原理与工业级落地实战。 - [第12讲:GPU-Util 100% 算力却只有 15%?:SM 执行、Warp 调度、Tensor Core 与 Roofline 模型的第一性原理](https://lilinji.mintlify.app/02_GPU硬件与集群互联/12_GPU执行与存储体系_SM_Warp_TensorCore_HBM_Roofline.md): 深入剖析 GPU 硬件执行与存储层次:从 SM 微架构、Warp 调度、Tensor Core MMA 原语到 Register/Shared Memory/L2/HBM 存储金字塔,结合 Arithmetic Intensity 与 Roofline 模型彻底破解 GPU 算力利用率指标陷阱。 - [第13讲:卡数翻倍算力为何不翻倍?:通信第一性原理、Alpha-Beta 建模与分层带宽阶梯](https://lilinji.mintlify.app/02_GPU硬件与集群互联/13_通信第一性原理与性能模型_AlphaBeta_Latency_Bandwidth.md): 深入剖析分布式训练与推理中的通信第一性原理:为什么并行切分必然打破计算局部性?掌握通信不可能三角、Alpha-Beta (α + S/β) 耗时模型五步穿透、分层物理带宽断崖与 Ring AllReduce 算法推导,建立五层通信优化阶梯。 - [第14讲:物理邻居还是异地恋?:GPU 节点与集群硬件拓扑](https://lilinji.mintlify.app/02_GPU硬件与集群互联/14_GPU节点与集群硬件拓扑_PCIe_NVLink_NVSwitch_Clos_Rail.md): 深入剖析单机 8 卡物理拓扑与万卡智算集群网络互联:拆解双路 CPU NUMA 陷阱、PCIe Switch 直通、4 颗 NVSwitch 全互联巨网、3 层 Clos/Fat-Tree 1:1 无收敛组网与 Rail-Optimized 轨道优化设计,掌握 Rank Placement 拓扑感知调度的第一性原理。 - [第15讲:内存旁路与任意门:RDMA 与 GPUDirect RDMA](https://lilinji.mintlify.app/02_GPU硬件与集群互联/15_RDMA与GPUDirect_RDMA_QP_WQE_CQ_MR_ZeroCopy.md): 深入剖析 AI 集群高速互联基石:彻底解剖传统 TCP/IP 协议栈三大原罪、RDMA 控制面与数据面分离本质、QP/WQE/CQ/MR 四大抽象硬件时序、单边 Write 保序陷阱,以及 GPUDirect RDMA 绕过 Host CPU 的 PCIe P2P 直通数据流。 - [第16讲:大厨不必亲自搬砖:机内数据搬运](https://lilinji.mintlify.app/02_GPU硬件与集群互联/16_机内数据搬运_LSU_TMA_CopyEngine_mbarrier_IPC.md): 深入剖析单卡内部与单机多卡数据搬运第一性原理:解密 SM 零和博弈、LSU vs TMA 硬件微架构对决、mbarrier 硬件级同步与 Phase 翻转、通算重叠 k 倍率膨胀与 Flux sm_margin 参数,以及 CUDA IPC 跨进程显存零拷贝共享。 - [第17讲:谁在敲击网卡门铃?:跨机数据搬运](https://lilinji.mintlify.app/02_GPU硬件与集群互联/17_机间数据搬运_GPU_Initiated_RDMA_IBRC_OneHop.md): 深入剖析跨机 GPU 数据搬运全栈机理:撕开 GPUDirect RDMA 仅统一数据面的面具,对比 CPU 代理控制(IBRC)与 GPU 核心直接敲击 Doorbell(IBGDA/NVSHMEM/GDRCopy)的微秒级时延对决;深度推导两跳聚合(Two-Hop Gateway)与一跳直达(One-Hop Direct)在 MoE 场景下的 Incast 拥塞与网络经济学算盘;拆解 DeepEP 单 Kernel 内 Warp 级角色分工与物理双通道零竞争哲学。 - [第18讲:破除 AllReduce 迷雾:NCCL 架构机理](https://lilinji.mintlify.app/02_GPU硬件与集群互联/18_NCCL通信库与Collective算子_Ring_Tree_NVLS_NVSHMEM.md): 深度解构 NVIDIA NCCL 集合通信核心机理:白板手推 Ring AllReduce $2\frac{P-1}{P}M$ 单卡恒定通信量公式;对决 Ring 环形拓扑与 Double Binary Tree 双二叉树在万卡规模下的时延爆炸与降维打击;拆解 Simple、LL、LL128 三大传输协议微架构;揭秘 NVSwitch 硬件网内计算(NVLS/SHARP);推导 Algorithm BW 与 Bus BW 黄金换算准则并实战 nccl-tests 性能验收。 - [第19讲:时空折叠的艺术:Compute-Communication Overlap 深度剖析](https://lilinji.mintlify.app/02_GPU硬件与集群互联/19_Compute_Communication_Overlap_Stream_Bucket_Chunk_WarpSpec.md): 深度解构分布式训练中计算与通信重叠(Overlap)的核心机理与性能工程:揭秘 Async 绝不等于 Overlap 的三大物理铁律;白板手推暴露通信耗时公式;全景拆解 DDP 25MB 梯度分桶与 FSDP 前向预取/反向流水线;深入 Megatron TP Comm Overlap 的 Chunk 切片微架构;量化 SM、L2 Cache 与 HBM 争抢的惩罚因子 $k$ 模型;终极解析 Hopper/Blackwell Warp Specialization 硬件解耦与 SM-free 演进。 - [第20讲:智算集群的听诊器:Benchmark、监控与 AI 集群故障诊断](https://lilinji.mintlify.app/02_GPU硬件与集群互联/20_Benchmark_监控与AI集群故障诊断_Xid_SlowNode_NCCL_Hang.md): 系统解构万卡 AI 智算中心稳定性保障与故障诊断体系:首创 Step Time 三层漏斗性能分解模型;深入慢节点(Straggler)与静默降频的“反向测谎”定位法;拆解千卡分布式训练 NCCL Hang 根因定位决策树;全景绘制 GPU Xid 致命错误代码、NVLink CRC、ECC 坏道与 RoCE/IB PFC 死锁风暴监控图谱;交付工业级集群巡检与秒级止血工程方案。 - [第21讲:算力战国的诸神黄昏:GPU 硬件全景与多元异构算力](https://lilinji.mintlify.app/02_GPU硬件与集群互联/21_GPU硬件全景与多元异构算力_NVIDIA代际演进_国产芯片与生态选型.md): 全景透视全球与国产 AI 算力微架构与生态选型:系统解构 NVIDIA Volta、Ampere、Hopper、Blackwell、Vera Rubin 五代硬件演进与护城河;深度对比通用 GPGPU 与专用 NPU 达芬奇脉动阵列在底层数据流与内存布局上的本质分歧;详尽评测华为昇腾、海光 DCU、寒武纪、沐曦、摩尔线程等国产芯片的技术栈(CANN/DTK/MUSA);交付工业级大模型异构迁移五步法与一云多芯生产落地准则。 - [🚀 第三篇:CUDA 编程与高性能算子优化 (CUDA & Operator Performance Engineering)](https://lilinji.mintlify.app/03_CUDA与算子性能优化/README.md): 系统学习 🚀 第三篇:CUDA 编程与高性能算子优化 (CUDA & Operator Performance Engineering) 的核心技术原理与工业级落地实战。 - [第22讲:为什么改了一行访问索引,算子吞吐暴跌10倍?:CUDA编程模型与内存层次深度解构](https://lilinji.mintlify.app/03_CUDA与算子性能优化/22_CUDA编程模型与内存层次_Thread_Block_Coalescing.md): 从GPU微架构第一性原理出发,深度穿透CUDA软件抽象与硅片物理硬件的绑定关系,手算DRAM Burst、128B缓存行与32B Sector,推导合并访存与Bank Conflict数学模型,并以4组完整可编译CUDA实验与Little's Law解构Occupancy调优本质。 - [第23讲:为什么Attention必须先算Max?:从 Naive Reduce 到 Fused Online Softmax 深度解构](https://lilinji.mintlify.app/03_CUDA与算子性能优化/23_经典算子优化_Reduce与Softmax_OnlineSoftmax_Fused.md): 从规约树与Warp Shuffle硬件原语出发,手算IEEE-754浮点溢出与Safe Softmax三遍扫描显存墙,严密推导Online Softmax动态修正因子递推与结合律证明,打通FlashAttention底座数学模型,并配套4组完整可编译CUDA实验与大厂白板推导。 - [第24讲:从 1% 到 95% 算力利用率的九重天跃迁:CUDA GEMM 分块](https://lilinji.mintlify.app/03_CUDA与算子性能优化/24_矩阵乘法核心_GEMM优化与TensorCore思维.md): 从0.25 FLOPs/Byte算术强度性能墙穿透到Block-Warp-Thread三级分块(Tiling)体系,手算2D寄存器外积复用代数模型,解构双缓冲与Ampere异步拷贝流水线,深度剖析Tensor Core Warp级矩阵乘微架构与Fragment映射,并配套4组完整可编译CUDA实验与大厂白板推导。 - [第25讲:为什么算 Attention 可以不存中间矩阵?:FlashAttention 原理剖析与 Triton 工业级实战](https://lilinji.mintlify.app/03_CUDA与算子性能优化/25_注意力算子深度优化_TiledAttention_FlashAttention_Triton.md): 系统学习 第25讲:为什么算 Attention 可以不存中间矩阵?:FlashAttention 原理剖析与 Triton 工业级实战 的核心技术原理与工业级落地实战。 - [🚀 第四篇:大模型架构与显存精细建模 (LLM Architecture & Memory Ledger)](https://lilinji.mintlify.app/04_大模型架构与显存建模/README.md): 系统学习 🚀 第四篇:大模型架构与显存精细建模 (LLM Architecture & Memory Ledger) 的核心技术原理与工业级落地实战。 - [第26讲:为什么现代大模型架构走向 Decoder-only 大一统?:从 MHA/GQA、RoPE 到 SwiGLU 深度解构与显存建模](https://lilinji.mintlify.app/04_大模型架构与显存建模/26_Decoder_only架构深度拆解_MHA_MQA_GQA_RoPE_SwiGLU.md): 系统学习 第26讲:为什么现代大模型架构走向 Decoder-only 大一统?:从 MHA/GQA、RoPE 到 SwiGLU 深度解构与显存建模 的核心技术原理与工业级落地实战。 - [第27讲:显存去哪儿了?:大模型训练与推理显存全景账本、FLOPs 白板手算与 KV Cache 容量规划](https://lilinji.mintlify.app/04_大模型架构与显存建模/27_训练与推理显存账本_FLOPs推导与KV_Cache容量规划.md): 系统学习 第27讲:显存去哪儿了?:大模型训练与推理显存全景账本、FLOPs 白板手算与 KV Cache 容量规划 的核心技术原理与工业级落地实战。 - [🚀 第五篇:大模型大规模分布式训练系统 (Distributed Training Systems)](https://lilinji.mintlify.app/05_大模型分布式训练/README.md): 系统学习 🚀 第五篇:大模型大规模分布式训练系统 (Distributed Training Systems) 的核心技术原理与工业级落地实战。 - [第28讲:为什么多卡训练不能只靠“加卡”?:DDP 分布式数据并行与通信/计算重叠](https://lilinji.mintlify.app/05_大模型分布式训练/28_DDP分布式数据并行与通信计算重叠.md): 系统学习 第28讲:为什么多卡训练不能只靠“加卡”?:DDP 分布式数据并行与通信/计算重叠 的核心技术原理与工业级落地实战。 - [第29讲:显存分片技术:ZeRO-1/2/3 与 PyTorch FSDP 深度剖析](https://lilinji.mintlify.app/05_大模型分布式训练/29_显存分片技术_ZeRO_1_2_3与PyTorch_FSDP深度剖析.md): 系统学习 第29讲:显存分片技术:ZeRO-1/2/3 与 PyTorch FSDP 深度剖析 的核心技术原理与工业级落地实战。 - [第30讲:模型并行与长序列基石:TP/PP/SP/CP 矩阵切分与硬件拓扑映射](https://lilinji.mintlify.app/05_大模型分布式训练/30_模型并行技术_TP_PP_SP_CP与硬件拓扑映射.md): 系统学习 第30讲:模型并行与长序列基石:TP/PP/SP/CP 矩阵切分与硬件拓扑映射 的核心技术原理与工业级落地实战。 - [第31讲:3D混合并行与MoE专家并行:全维度切分设计与千卡训练故障排查](https://lilinji.mintlify.app/05_大模型分布式训练/31_3D混合并行_MoE专家并行与大规模训练故障排查.md): 系统学习 第31讲:3D混合并行与MoE专家并行:全维度切分设计与千卡训练故障排查 的核心技术原理与工业级落地实战。 - [🚀 第六篇:大模型在线推理系统与性能工程 (LLM Serving & Inference Optimization)](https://lilinji.mintlify.app/06_LLM推理系统与性能工程/README.md): 系统学习 🚀 第六篇:大模型在线推理系统与性能工程 (LLM Serving & Inference Optimization) 的核心技术原理与工业级落地实战。 - [第32讲:为什么吞吐高长尾却崩了?:LLM 在线推理两阶段](https://lilinji.mintlify.app/06_LLM推理系统与性能工程/32_LLM推理两阶段_Prefill_Decode与核心SLO指标.md): 直面生产大模型在线推理的最底层物理冲突:从 Prefill(Compute-Bound)与 Decode(Memory-Bound)的算术强度断崖、Roofline 硬件模型投影,到 KV Cache 显存四账本、TTFT/TPOT/ITL 核心 SLO 体系,层层拆解 Continuous Batching、Chunked Prefill 与 PD 解耦架构的工程必然性。 - [第33讲:显存碎片吞噬了60%算力?:KV Cache 内存管理演进:PagedAttention、Continuous Batching 与 Chunked ](https://lilinji.mintlify.app/06_LLM推理系统与性能工程/33_KV_Cache管理演进_PagedAttention与ContinuousBatching.md): 直击大模型在线推理系统的显存与调度核心:深入剖析传统连续显存预分配下的内部碎片与外部碎片危机,从操作系统虚拟分页第一性原理推导 PagedAttention 的 Block Table 映射与 Copy-on-Write 机制,层层拆解 Continuous Batching 迭代级组批状态机,并攻克 Chunked Prefill 与显存抢占(Swapping vs Recomputation)的底层系统工程。 - [第34讲:从内核源码到极致黑魔法:vLLM 生产级系统架构全景剖析与四重加速引擎](https://lilinji.mintlify.app/06_LLM推理系统与性能工程/34_vLLM系统架构剖析与高阶加速技术.md): 直面大模型工业级在线 Serving 的工程之巅:从 vLLM V1 核心架构(AsyncLLMEngine、KVCacheManager、BlockPool)全栈代码走读,到 Prefix Caching(Radix Tree)、Piecewise CUDA Graph 图编译切片、FP8/AWQ/Marlin 极限制低比特量化,直至 Speculative Decoding(投机采样)先猜后验数学证明与加速边界,层层剥离现代推理引擎榨干硬件算力的四重黑魔法。 - [第35讲:算存矛盾与解耦革命:分布式推理并行拓扑](https://lilinji.mintlify.app/06_LLM推理系统与性能工程/35_分布式推理与PD分离架构_Prefill_Decode_Disaggregation.md): 深入大模型分布式推理与下一代 Serving 架构之巅:从推理并行拓扑(TP/PP/DP/EP)的硬件拓扑映射与通信时延边界,到 Prefill(Compute-Bound)与 Decode(Memory-Bound)的物理资源死结,彻底剖析 PD 分离(Disaggregation)核心动因。全面拆解 KV Cache 跨机搬运三大维度(Push vs Pull、Eager vs Pipelined、RDMA vs NIXL/Mooncake)、分层分布式缓存存储池(HBM/DRAM/SSD)、全链路预测调度(Conductor)与容量规划,攻克千路并发下长尾延迟 P99 击穿难题。 - [第36讲:为什么按平均 QPS 算集群上线必死?:大模型在线推理容量规划、SLO 治理与生产级故障排障全景实战](https://lilinji.mintlify.app/06_LLM推理系统与性能工程/36_在线推理容量规划_SLO治理与生产故障诊断.md): 直面生产大模型在线推理最残酷的容量与稳定性真相:从大模型非线性资源消耗、显存四账本手算,到基于真实潮汐流量曲线的 GPU 集群精准容量规划;从 TTFT/TPOT/Goodput Pareto 边界治理、感知型网关调度,到显存 OOM、Prefix Cache 击穿与 TP 掉队死锁排障 Runbook,全景构筑高可用大模型 Serving 工业防线。 - [🚀 第七篇:云原生 AI 平台与生产工程 (Cloud-Native AI Platform & Production Engineering)](https://lilinji.mintlify.app/07_云原生AI平台与生产工程/README.md): 系统学习 🚀 第七篇:云原生 AI 平台与生产工程 (Cloud-Native AI Platform & Production Engineering) 的核心技术原理与工业级落地实战。 - [第37讲:从 cgroups 盲区到千万级异构拓扑调度:GPU 容器化底座、NVIDIA Container Toolkit 与 K8s Device Plug](https://lilinji.mintlify.app/07_云原生AI平台与生产工程/37_GPU容器化与Kubernetes_Device_Plugin_DRA.md): 深入拆解 Linux 容器对 GPU 硬件管理的物理盲区,剖析从 nvidia-docker 到 NVIDIA Container Toolkit 与 CDI 的全栈注入流水线;深度还原 Kubernetes Device Plugin 的 gRPC 状态机与整数标量分配硬伤,穿透下一代 DRA(动态资源分配)结构化参数与异构拓扑感知革命。 - [第38讲:从“死锁占坑”到细粒度算力切分:AI 任务高级调度](https://lilinji.mintlify.app/07_云原生AI平台与生产工程/38_AI任务调度与多租户隔离_Gang_Kueue_HAMi_GPUSharing.md): 深入剖析分布式训练中的抢跑死锁与资源碎片物理本质,解密 Kubernetes 原生调度门与 Gang Scheduling(All-or-Nothing)算法状态机;深度穿透 Kueue 层次化队列与多租户弹性借调机制,横向对比 MIG、MPS、Time-slicing 与 HAMi 用户态 CUDA API 劫持切分,打通训练推理混部工业级落地闭环。 - [第39讲:从“流式卡死”到毫秒级自愈:生产级 LLM Serving 高可用架构、DCGM 全维可观测与基于 KV Cache 水位的 KEDA 自动扩缩容全栈](https://lilinji.mintlify.app/07_云原生AI平台与生产工程/39_生产级AI_Serving高可用_可观测与SLO治理.md): 深入剖析大模型在线服务与传统微服务的本质差异,从 TTFT、TPOT、ITL 语义延迟指标到 DCGM 硬件微架构监控建立全维可观测体系;破解传统 HPA 面对 GPU 静态预占与流式输出时的扩缩容失效困局,详解基于 KEDA、KV Cache 显存水线与请求排队深度的毫秒级弹性扩缩与网关自适应背压降级工业级落地方案。 - [第40讲:从 Checkpoint 吞吐血崩到毫秒级 KV 命中:大模型分布式存储底座、DeepSeek 3FS 架构、异步快照与多级缓存体系全栈实战](https://lilinji.mintlify.app/07_云原生AI平台与生产工程/40_大模型分布式存储_Checkpoint与缓存体系架构.md): 深度剖析千卡大模型训练中的突发写入断崖、POSIX/Ceph 元数据锁死灾难、DeepSeek 3FS 极简全 RDMA 与 CRAQ 并行文件系统内核机制、异步无感 Checkpoint 内存快照技术,以及面向大模型推理长文本的四级 KV Cache 缓存金字塔设计。 - [🚀 第八篇:Post-Training 与相邻 AI Infra (Adjacent Workloads & Heterogeneous Computing)](https://lilinji.mintlify.app/08_Post-Training与相邻Infra/README.md): 系统学习 🚀 第八篇:Post-Training 与相邻 AI Infra (Adjacent Workloads & Heterogeneous Computing) 的核心技术原理与工业级落地实战。 - [第41讲:从显存爆炸到千行代码实测:SFT、LoRA 与 RLHF](https://lilinji.mintlify.app/08_Post-Training与相邻Infra/41_SFT_LoRA与RLHF系统负载与资源评估.md): 深度解构大模型对齐与后训练全生命周期(Full SFT、LoRA/QLoRA、PPO 四模型、DPO 双模型与 DeepSeek-R1 GRPO 群组相对优化)的算力开销、动态显存模型、训练与推理混合工作流的调度冲突,以及 Multi-LoRA 生产高并发 Serving 的底层实现。 - [第42讲:从向量检索穿透到 Agent 沙箱隔离:高并发 VectorDB 底座、Radix Context 缓存与多租户安全执行环境全栈实战](https://lilinji.mintlify.app/08_Post-Training与相邻Infra/42_RAG与Agent基础设施_VectorDB_Context_Sandbox.md): 深度解构大模型 RAG(检索增强生成)与 Agent(智能体)端到端系统级基础设施,从百万级高维向量相似度检索(HNSW/IVF-PQ/混合搜索 RRF)、动态长上下文前缀缓存(Radix Context Caching)与 TTFT 毫秒级治理,到多租户代码执行沙箱(gVisor、Firecracker、Landlo - [第43讲:打破单一 CUDA 锁死:NPU、DPU 与异构加速器硬件抽象架构全栈实战](https://lilinji.mintlify.app/08_Post-Training与相邻Infra/43_NPU_DPU与异构加速器硬件抽象.md): 深度解构非 NVIDIA 生态(华为昇腾 Ascend NPU、Google TPU、AMD ROCm)的达芬奇 Cube 微架构、分形数据排布(NZ/NC1HWC0)与编译图优化,剖析 PyTorch 跨设备硬件抽象层(HAL/PrivateUse1)机制,并揭示 DPU(数据处理器)在网络通信卸载、存储加速与在网计 - [第44讲:从八股背诵到白板手撕:AI Infra 大厂全真面试演练与系统设计题库全栈实战](https://lilinji.mintlify.app/08_Post-Training与相邻Infra/44_AI_Infra大厂全真面试演练与系统设计题库.md): 全面打破“背八股文”的虚假繁荣,直面一线大厂(阿里、字节、腾讯、美团、阶跃、MiniMax 等)最严苛的 AI Infra 面试试金石。从 405B 千卡资源与 3D 并行白板手算、NCCL 线上雪崩排查树,到万卡级统一训练推理集群端到端 System Design 终局答辩实战。 - [🚀 第九篇:生产级 Capstone 综合实战项目库 (Production Capstone Projects & Architecture RFCs)](https://lilinji.mintlify.app/09_Capstone综合实战项目/README.md): 系统学习 🚀 第九篇:生产级 Capstone 综合实战项目库 (Production Capstone Projects & Architecture RFCs) 的核心技术原理与工业级落地实战。 - [项目一:扩展性悬崖之谜:分布式 LLM 训练 Scaling Study 综合实战](https://lilinji.mintlify.app/09_Capstone综合实战项目/01_Capstone_分布式训练Scaling_Study实战.md): 从第一性原理穿透分布式训练扩展定律:手推 MFU 算力利用率,剖析 DDP 通信与反向计算重叠、FSDP 显存与通信博弈,实测 1 到 64 卡跨机 Scaling 效率断崖根因,并交付全套自动化评测分析代码。 - [项目二:时延与吞吐的双面博弈:生产级 LLM Serving 性能极限调优](https://lilinji.mintlify.app/09_Capstone综合实战项目/02_Capstone_生产级LLM_Serving吞吐与延迟优化实战.md): 直面在线大模型推理的核心矛盾:手算 Prefill 与 Decode 算术强度鸿沟,深拆 PagedAttention 物理分页与碎片率控制,揭秘 Chunked Prefill 削平 TTFT 长尾的底层微架构,交付容量规划与 Pareto 最优压测完整工具链。 - [项目三:榨干片上 SRAM:CUDA Softmax 与 Attention 算子极致性能调优](https://lilinji.mintlify.app/09_Capstone综合实战项目/03_Capstone_CUDA_Attention算子极致性能优化实战.md): 直面长文本注意力的内存墙绝境:手推标准 Attention 的 O(N^2) 显存读写代价,严密证明 Online Softmax 单趟流式更新数学递推,深拆 SRAM 分块平铺、Bank Conflict 消除与 Warp Shuffle 寄存器归约,交付可运行的 FlashAttention-2 算法复现与 Roofline 性能剖析器。 - [项目四:万卡熔炉的定海神针:企业级 AI Platform 统一调度与集群系统架构设计 RFC](https://lilinji.mintlify.app/09_Capstone综合实战项目/04_Capstone_企业级AI_Platform统一调度与集群架构RFC.md): 直面千卡超算中心的资源撕裂绝境:深拆 Gang 调度死锁规避与 Kueue 弹性配额借用算法,解构 HAMi 动态显存拦截与算力切分,手撕 8x400G 双轨网络与四级存储流水线,输出一套生产级万卡集群统一平台架构设计 RFC 与自愈调度系统。 - [项目五:从单算子到端到端:FlashAttention 全景演进与大模型 Token 生成全链路性能优化实战](https://lilinji.mintlify.app/09_Capstone综合实战项目/05_Capstone_FlashAttention全景与Token生成端到端全链路优化实战.md): 直面大模型生产推理中算力与访存的双重极端绝境:深度拆解 FlashAttention-1/2/3 微架构原理与 SRAM 流式 Tiling,严密推导 Online Softmax 递推更新;贯通 Prefill 算力受限与 Decode 访存墙两大阶段,全景解构 PagedAttention、MQA/GQA/MLA、连续批处理、Chunked Prefill、投机采样与 PD 分离架构,交付高保真 Python 可运行仿真器与大厂面试白板题解。 This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.