MoE 大规模分布式推理工程实战:从 All-to-All 通信到动态专家放置 深入拆解 MoE(Mixture of Experts)大规模分布式推理的工程实现:All-to-All 通信优化、DualPipe 架构、专家复制与放置策略、动态负载均衡、容错恢复机制,以及基于 DeepSeek-V3 的生产部署经验。 分布式系统 2026年10月05日 0 点赞 0 评论 39 浏览
DeepSeek-V3 Multi-head Latent Attention (MLA) 深度工程:低秩 KV Cache 压缩与分布式推理优化 深度解析 DeepSeek-V3 核心创新 MLA 机制:通过低秩联合压缩将 KV Cache 内存占用降低 320 倍,同时保持完整注意力表达能力。涵盖数学原理、CUDA kernel 融合实现、分布式推理优化以及与 MoE 的协同效应。 推理部署 2026年10月07日 0 点赞 0 评论 36 浏览