性能工程

CPU 缓存预取与内存级并行:深度工程实战

本文深入探讨现代 CPU 缓存预取机制与内存级并行技术,从硬件预取器架构到软件预取指令的工程实践,通过矩阵遍历、链表加速、图遍历等实战案例,揭示如何突破内存墙瓶颈实现性能数量级提升。

CPU 乱序执行引擎深度工程实战:从 Tomasulo 算法、寄存器重命名到 ROB 提交与精确异常的性能调优全解

拆解乱序执行引擎的四层机制:Tomasulo 保留站与 CDB 广播如何用重命名消灭 WAR/WAW 假相关;ROB 如何在乱序执行之上重建顺序提交与精确异常;物理寄存器堆的回收时机;现代发射队列 wakeup/select 的单周期时序约束。附可运行的 Tomasulo 模拟器、Top-down 微架构分析(TMA)下钻流程与生产陷阱清单。

深入理解 CPU 分支预测器——从 Tournament Predictor 到 TAGE 的推测执行安全实战

现代CPU分支预测器深度技术长文:从2-bit饱和计数器到TAGE-SC-L的完整演进,涵盖局部历史/全局历史/混合预测器/Tagged几何级数预测器/间接跳转ITTAGE/返回栈缓存RSB的硬件实现,以及Spectre-v1/v2、Meltdown的微架构攻击面与Linux内核KPTI/Retpoline/IBRS/eIBRS/SpecBHB工程缓解实践