Google TPU v6 (Trillium) 架构深度解析:从 MXU 矩阵引擎到 JAX 万卡分布式训练 深入解析 Google TPU v6 (Trillium) 的 MXU 脉动阵列微架构、ICI 芯片间互连拓扑、HBM 内存子系统,并结合 JAX/XLA 编译器实战万卡分布式训练的工程优化策略。 分布式系统 2026年10月03日 0 点赞 0 评论 65 浏览
JAX/XLA 编译器基础设施深度解析:从 Python 函数到分布式 GPU 代码的编译之旅 深入拆解 JAX 的编译流水线,从 trace 机制到 HLO 优化、从自动微分规则推导到 GSPMD 分区器,揭示这套系统如何将 Python 代码转化为跨数百个 TPU/GPU 运行的高性能计算图。 编译原理 2026年10月04日 0 点赞 0 评论 57 浏览
Inside JAX:XLA 编译器如何将 Python 函数编译为 GPU PTX 代码 深入拆解 JAX/XLA 核心编译机制:Tracing 编译模型、HLO 中间表示、算子融合、自动并行化(GSPMD)、自定义VJP与性能调优实战 编译原理 2026年10月05日 0 点赞 0 评论 41 浏览
Pallas GPU 内核编程:XLA 编译器 + Hopper TMA 异步拷贝的 SMEM 流水线深度实战 Pallas 是 JAX/XLA 生态中用于编写高性能自定义 GPU 的底层编程模型,它通过 pallas_call 入口和 AsyncCopy 原语,让开发者既能利用 XLA 编译器的全局优化能力,又能精细控制 Hopper 架构的 Tensor Memory Accelerator (TMA) 硬件单元。 Prompt工程 2026年10月07日 0 点赞 0 评论 41 浏览