Skip to content

Part 6: GPU 加速

CPU 是正确性的参照,GPU 是性能的主力。本主题覆盖 Metal(macOS)/ CUDA(NVIDIA)/ ROCm(AMD Strix Halo)三个 GPU 后端,以及 Flash Attention、分布式推理张量并行SSD streaming 与多 GPU 放置等关键优化。

涵盖内容

章节核心主题
GPU 后端抽象ObjC 互操作、Metal/CUDA/ROCm kernel、Flash Attention、零拷贝
分布式 & 张量并行Coordinator/Worker 流水线并行、Mac RDMA / CUDA 张量并行
多 GPU 放置--gpu-vram/--gpu-devices、层打包、跨设备 P2P 拷贝
多模型后端DeepSeek Flash 原生批处理、GLM 5.2 三后端路径
总结回顾ds4.c 设计哲学与 15 天知识串联

核心概念

前置知识

  • Part 3(Attention、量化)
  • Part 4(推理循环、RoPE)
  • Part 5(推理服务全貌)

学习路径

读完本主题后,你将理解:

  1. Metal/CUDA/ROCm 如何将 CPU 参考实现映射为 GPU kernel
  2. Flash Attention 的 online softmax 和分块计算策略
  3. 流水线并行与张量并行两种多机/多卡扩展方式的区别
  4. 多 GPU 放置(层打包)与 SSD streaming 如何突破单机内存
  5. ds4.c 整体架构的总结和回顾

→ 完成!回到 知识地图 查看全局视图。