分布式系统

LLM 推理 Disaggregated Architecture:Prefill-Decode 分离架构深度实战

随着大模型推理规模从单机走向多机,Prefill与Decode阶段的计算特征差异成为系统瓶颈的根本原因。本文深入剖解NVIDIA Dynamo、Mooncake等工业界Disaggregated Inference架构的设计哲学,涵盖KV Cache传输优化、分布式调度算法、负载均衡策略,并结合真实生产环境数据给出工程实践指南。

万亿参数大模型推理系统架构:从显存墙到多节点部署的实战工程

深入剖析万亿参数大模型推理的系统化工程架构,涵盖TP/PP/EP/DP四维并行策略组合、KV Cache三级存储/H2O淘汰策略、MXFP4/FP8量化协同、vLLM多节点部署实战(含docker-compose配置)、PD分离架构与Ray调度层调优、关键监控指标与自适应batch调度,以及HBM4-PIM/光学互连/联邦推理等前沿方向展望。