ARM SME 矩阵扩展:LLM 推理底层算子的深度工程实践 从 ARMv9.2-A 指令集到 Apple M4 与 Ampere Altra 的实矩阵乘法加速路径。深度剖析 SME 的 ZA 存储模型、FMOPA 外积指令、BF16 GEMM 实现、Attention Score 算子优化,以及 llama.cpp 集成实战与性能调优数据。 推理部署 2026年10月07日 0 点赞 0 评论 44 浏览
DeepSeek-V3 Multi-head Latent Attention (MLA) 深度工程:低秩 KV Cache 压缩与分布式推理优化 深度解析 DeepSeek-V3 核心创新 MLA 机制:通过低秩联合压缩将 KV Cache 内存占用降低 320 倍,同时保持完整注意力表达能力。涵盖数学原理、CUDA kernel 融合实现、分布式推理优化以及与 MoE 的协同效应。 推理部署 2026年10月07日 0 点赞 0 评论 36 浏览