Appearance
Part 6: GPU 加速
CPU 是正确性的参照,GPU 是性能的主力。本主题覆盖 Metal(macOS)/ CUDA(NVIDIA)/ ROCm(AMD Strix Halo)三个 GPU 后端,以及 Flash Attention、分布式推理、张量并行、SSD streaming 与多 GPU 放置等关键优化。
涵盖内容
| 章节 | 核心主题 |
|---|---|
| GPU 后端抽象 | ObjC 互操作、Metal/CUDA/ROCm kernel、Flash Attention、零拷贝 |
| 分布式 & 张量并行 | Coordinator/Worker 流水线并行、Mac RDMA / CUDA 张量并行 |
| 多 GPU 放置 | --gpu-vram/--gpu-devices、层打包、跨设备 P2P 拷贝 |
| 多模型后端 | DeepSeek Flash 原生批处理、GLM 5.2 三后端路径 |
| 总结回顾 | ds4.c 设计哲学与 15 天知识串联 |
核心概念
- kv-cache — GPU 端的 KV 缓存管理(CUDA Managed Memory)
- softmax — Flash Attention 中的 online softmax
- quantization — GPU 反量化 kernel
- rope — GPU 端的 RoPE 计算
- distributed-inference — 流水线并行(按层切片跨机)
- tensor-parallelism — 张量并行(同 token 同时刻切层内工作量)
- session-batching — 多会话 decode 批处理
- ssd-streaming — 路由专家 SSD 缓存,突破单机内存
前置知识
学习路径
读完本主题后,你将理解:
- Metal/CUDA/ROCm 如何将 CPU 参考实现映射为 GPU kernel
- Flash Attention 的 online softmax 和分块计算策略
- 流水线并行与张量并行两种多机/多卡扩展方式的区别
- 多 GPU 放置(层打包)与 SSD streaming 如何突破单机内存
- ds4.c 整体架构的总结和回顾
→ 完成!回到 知识地图 查看全局视图。