显存优化

LLM 后训练量化深度实战:从 GPTQ/AWQ 到 FP8 与 KV Cache 量化的显存-带宽极限工程

从 Roofline 模型定量证明 decode 阶段 Tensor Core 利用率仅 0.33% 的内存墙困境出发,系统拆解 LLM 后训练量化的完整工程栈:group-wise 量化粒度、SmoothQuant 的 outlier 迁移、GPTQ 的 Hessian 误差补偿、AWQ 的激活感知缩放、FP8 延迟缩放与 KV Cache 分级量化,并给出逐层重建误差定位法与生产选型决策树。

大模型分布式训练并行与显存工程实战:从 ZeRO 分片、FSDP 扁平参数到激活重计算与通信重叠全链路

沿真实工程决策链拆解大模型分布式训练:先算清混合精度 AdamW 的 16 字节/参数显存账本,再区分 DP/TP/PP 三种并行各自解决的维度,深入 ZeRO 三级分片与 FSDP FlatParameter 编排(含 70B 在 64 卡上的单卡显存实测表),给出选择性激活重计算的算力-显存兑换率与 use_reentrant 陷阱,最后落到 prefetch、bucket 与梯度累积 no_sync 的通信-计算重叠实战。