CXL 内存扩展在 AI 训练中的实践:梯度检查点、优化器状态与生产部署 深入剖析 CXL (Compute Express Link) 内存在 AI 训练工作负载中的架构设计与工程实践,涵盖 ZeRO-Infinity offload 策略、PyTorch 自定义 CXL 分配器、性能基准测试以及与 HBM/NVMe 的层级对比。 服务器运维 2026年10月01日 0 点赞 0 评论 46 浏览
Linux 分级内存管理深度实战:CXL、HBM 与 NUMA 分层架构完全指南 从传统 NUMA 到异构内存体系的深度解析:涵盖 CXL 3.0 内存池化、HBM 与 DRAM 分层、Linux 内核层级内存管理框架(Demotion/Promotion)、加权交织策略、CXL 交换机场景下的页面放置优化,附完整配置与基准测试数据。 内存管理 2026年10月03日 0 点赞 0 评论 45 浏览
从第一性原理推导 Flash Attention:IO 复杂度、Tiling 策略与在线 Softmax 的数学工程 从第一性原理出发,深入推导 Flash Attention 的核心数学变换,分析 IO 复杂度下界,解析在线 Softmax 的修正引理,讨论 Tiling 策略、SRAM 分区与工程落地中的关键细节。覆盖 Flash Attention 1/2/3 的演进与不同硬件的调优参数。 算法与数据结构 2026年10月07日 0 点赞 0 评论 28 浏览
UCIe (Universal Chiplet Interconnect Express) 小芯片互联协议栈深度解析 后摩尔时代 Chiplet 产业变革,UCIe 开放互联标准协议栈从物理层到系统层深度解析,涵盖 PAM4 信号完整性、流控机制、AI 加速器多芯粒架构设计 芯片架构 2026年10月07日 0 点赞 0 评论 16 浏览