LLM推理PD分离架构深度工程实践:从Prefill-Decode异构到分布式KV Cache传输 深入剖析LLM推理PD分离架构的工程实践:从Prefill-Decode异构到分布式KV Cache传输,涵盖DistServe、Mooncake、NVIDIA Dynamo等系统的设计原理与传输协议优化。 推理部署 2026年10月01日 0 点赞 0 评论 59 浏览
GPU多租户能效调度:时分复用、显存碎片化与NVSwitch拓扑感知的联合工程优化 深入分析GPU时分复用原理、显存碎片化根因及Sub-page Allocation解决方案,结合NVSwitch拓扑感知调度和Perf/Watt能效优化维度,构建生产级多目标联合调度框架。 编译原理 2026年10月02日 0 点赞 0 评论 47 浏览
GPU 推理进入「后摩尔」时代:NVIDIA Blackwell 架构全栈深度实战 从硬件微架构出发,深入 FP4/FP6 Tensor Core、第五代 NVLink Switch 和 MIG 增强,结合生产环境部署实测数据,给出 Blackwell 集群的端到端调优方法论。 全栈开发 2026年10月06日 0 点赞 0 评论 43 浏览