Mooncake 与分离式 LLM 推理:KV Cache 传输、缓存与 Prefill-Decode 解耦深度工程实战 深度解析分离式LLM推理架构的设计哲学与工程实现,聚焦KV Cache传输协议、分布式缓存管理、RDMA高效传输、生产部署实践,以Mooncake/Prefill-Decode解耦为例 推理部署 2026年10月02日 0 点赞 0 评论 55 浏览
大模型推理引擎 KV Cache 三级存储架构:从 GPU HBM 到 CPU DRAM 再到 NVMe SSD 的工程实践 深度剖析大推理引擎中 KV Cache 跨 GPU HBM、CPU DRAM、NVMe SSD 三级存储的调度架构与工程实现,涵盖 PagedAttention 的页表管理、CPU 换入换出策略、NVMe KV Cache 引擎设计、预取与淘汰算法,以及 2026 年最新方案对比(vLLM、SGLang、Mooncake、DistServe),附生产级性能基准与优化实践。 安全与虚拟化 2026年10月02日 0 点赞 0 评论 58 浏览
深入理解 GPU Tensor Core 架构与 CUDA 编程实战:从 Ampere 到 Blackwell 的 AI 高性能计算 从工业级 AI 计算的视角,系统性梳理 NVIDIA Tensor Core 的架构演进(Volta→Ampere→Hopper→Blackwell),深入讲解 CUDA WMMA API、Hopper TMA 异步拷贝、Warp Group wgmma 指令、共享内存 Swizzle、多级流水线设计,并提供 FP8 混合精度 GEMM 内核实战案例与 Nsight Compute 性能剖析指南。 GPU并行计算 2026年10月02日 0 点赞 0 评论 44 浏览
万亿参数大模型推理系统架构:从显存墙到多节点部署的实战工程 深入剖析万亿参数大模型推理的系统化工程架构,涵盖TP/PP/EP/DP四维并行策略组合、KV Cache三级存储/H2O淘汰策略、MXFP4/FP8量化协同、vLLM多节点部署实战(含docker-compose配置)、PD分离架构与Ray调度层调优、关键监控指标与自适应batch调度,以及HBM4-PIM/光学互连/联邦推理等前沿方向展望。 推理部署 2026年10月03日 0 点赞 0 评论 58 浏览
AMD Instinct MI300X 显存子系统与 AI 推理深度实战:从 HBM3 带宽榨取到 Infinity Fabric 全互联扩展 深入分析 AMD Instinct MI300X 的 192GB HBM3 显存子系统、3.5D Chiplet 封装、Infinity Fabric 全互联拓扑,并通过 HIP 编程实战展示如何在 ROCm 生态中榨取每一字节带宽。涵盖 MFMA 指令优化、L2/L3 缓存协同、8 卡 mesh 扩展以及与 H200/B200 的架构对比。 工程实践 2026年10月04日 0 点赞 0 评论 37 浏览
CUDA Tensor Memory Accelerator (TMA) 深度工程:Hopper 架构的异步张量搬运引擎 从硬件机制到 CuTe 编程模型,全方位拆解 NVIDIA Hopper 架构引入的 Tensor Memory Accelerator (TMA)。涵盖 cp.async.bulk、多维张量描述符、mbarrier 多级流水线同步,以及 TMA + WGMMA 协同实现 940+ TFLOPS 的工程实践。 GPU并行计算 2026年10月07日 0 点赞 0 评论 37 浏览
AMD Instinct MI300 系列深度架构解析:CDNA3 矩阵核心、统一内存与 AI 训练工程实践 从芯片微架构到系统互连,深度解析 AMD Instinct MI300 系列(MI300A/MI300X)的 CDNA3 架构设计:统一内存 APU 路线、Infinity Fabric 互连技术、ROCm 开放软件栈,以及大模型训练中的工程实践。 网络技术 2026年10月07日 0 点赞 0 评论 21 浏览