Elastic Quarantines: Engineering Rowhammer Mitigation for AI Training Clusters with ECC and TRR 从DRAM物理特性出发,深入分析Rowhammer攻击对AI训练集群的威胁,以及工程层面如何通过ECC、TRR、pTRR、DDR5新特性和操作系统级缓解措施构建纵深防御。 模型微调 2026年10月04日 0 点赞 0 评论 73 浏览
从 XID 错误到芯片级容错:GPU 显存 ECC 损坏在 AI 训练中的检测、隔离与自愈工程 AI 训练集群规模从百卡扩展到千卡、万卡级别后,GPU 显存错误成为影响训练稳定性和模型收敛性的隐性杀手。与传统 CPU 不同,GPU 显存错误往往表现为"静默数据损坏"(Silent Data Corruption, SDC)——权重悄然翻转一个 bit,Loss 曲线异常抖动,而训练流程本身不会报错退出。本文从硬件 ECC 机制出发,深入讲解 GPU XID 事件解析、内核驱动级错误检测、生产… 芯片架构 2026年10月07日 0 点赞 0 评论 25 浏览
Linux 内核 Memory Failure 深度工程:从 MCE 异常到生产级内存故障自愈系统 深入解析 Linux 内核 Memory Failure 子系统,从 MCE 异常触发到页面毒化(HWPoison)的完整链路,涵盖 EDAC 监控、生产自愈 Daemon、预测性 DIMM 替换策略等实战部署方案。 内存管理 2026年10月07日 0 点赞 0 评论 28 浏览