GPU 并行计算深度实战:从 CUDA 核心编程到内存层次的全栈优化 从GPU硬件微架构出发系统梳理CUDA编程核心抽象、内存层次优化策略以及性能调优方法论,覆盖SIMT模型、合并访问、Bank Conflict、Register Tiling、Tensor Core编程、Roofline分析等主题。 GPU并行计算 2026年10月11日 0 点赞 0 评论 9 浏览
FlashAttention 算法深度解析:从 IO-Aware 优化到 GPU 硬件极致 FlashAttention 通过 IO-Aware 的 Tiling + Recomputation 策略,将 Self-Attention 的 HBM 访问复杂度从 O(N²) 降至 O(N²/d),在不牺牲数学精度的前提下实现 2-4× 端到端训练加速。本文深入推导 Online Softmax 数学基础、解析 FlashAttention/2/3 三代算法演进、剖析 Hopper/Tensor Core 适配优化,并给出一套完整的工程性能分析框架。 GPU并行计算 2026年10月09日 0 点赞 0 评论 14 浏览
GPU 显存碎片化深度实战:从 Buddy 分配器、expandable_segments 到碎片率治理与 CUDA OOM 修复 每一个在 A100/H100 上跑过大模型训练或长上下文推理的工程师,大概率都见过这样一个让人抓狂的报错: GPU并行计算 2026年10月08日 0 点赞 0 评论 17 浏览
WebGPU SIMT 子群组操作与矩阵乘法 AI 推理协同优化:从 Warp Shuffle 到 Hopper WGMMA 的全栈工程 深入剖析 WebGPU 子群组(SIMT subgroup)原语如何映射到 NVIDIA Warp Shuffle、AMD GCN Wave Intrinsics 以及 Hopper WGMMA 指令,提供可落地的矩阵乘法优化实现,演示如何在不依赖 CUDA 生态的前提下,通过跨平台着色器语言实现生产级 AI 推理加速。 GPU并行计算 2026年10月07日 0 点赞 0 评论 36 浏览
CUDA Tensor Memory Accelerator (TMA) 深度工程:Hopper 架构的异步张量搬运引擎 从硬件机制到 CuTe 编程模型,全方位拆解 NVIDIA Hopper 架构引入的 Tensor Memory Accelerator (TMA)。涵盖 cp.async.bulk、多维张量描述符、mbarrier 多级流水线同步,以及 TMA + WGMMA 协同实现 940+ TFLOPS 的工程实践。 GPU并行计算 2026年10月07日 0 点赞 0 评论 37 浏览
GPU 时间片调度与多租户推理隔离工程实践 深入剖析GPU多租户共享技术栈:从MPS轻量级并发到MIG硬件分区,从CUDA时间片抢占到推理引擎级Tag-Based公平调度。覆盖NVIDIA H100/Blackwell架构、vLLM、TensorRT-LLM等生产级架构实战。 GPU并行计算 2026年10月06日 0 点赞 0 评论 34 浏览
Rust × CUDA Driver API 零拷贝 FFI 实战:从 Pinned Memory 到 IPC 跨进程 GPU 共享 深度解析 Rust 与 CUDA Driver API 的零拷贝 FFI 互操作,覆盖 bindgen 绑定、Pinned Memory 分配、Async Stream 回调桥接、CUDA IPC 跨进程 GPU 内存共享,附带完整代码示例与性能基准对比。 GPU并行计算 2026年10月06日 0 点赞 0 评论 38 浏览
WebGPU Compute Shader 实时光线追踪——从 BVH 加速遍历到 PBR 材质渲染 深入探讨如何在 WebGPU 中从零构建实时光线追踪渲染器,涵盖 BVH 构建与遍历、Möller–Trumbore 光线-三角形求交、PBR 材质模型、多重重要性采样及 WGSL 工程优化 GPU并行计算 2026年10月05日 0 点赞 0 评论 30 浏览
从零编写 GPU 驱动:Asahi Linux AGX 架构与 Apple M 系列图形栈逆向工程 Asahi Linux从零开始为Apple M系列芯片编写GPU驱动的工程实践,涵盖逆向工程方法论、Rust驱动架构、统一地址空间管理、命令缓冲区调度等深度内容 GPU并行计算 2026年10月03日 0 点赞 0 评论 56 浏览
SYCL/oneAPI 异构计算编程模型:从 CUDA 锁定到跨平台 GPU 编程的实战突围 深入解析 SYCL 2020 标准的核心抽象(buffer/accessor、ND-Range、USM),对比 CUDA 生态的差异与优势,并通过生产级推理引擎集成案例展示如何在 NVIDIA/AMD/Intel 三大平台上用一套代码完成高性能 GEMM 计算。包含 sub-group shuffle、双队列 pipeline、AdaptiveCpp 单一源码多后端的实战技巧,以及 ResNet-50 跨平台性能基准数据。 GPU并行计算 2026年10月02日 0 点赞 0 评论 51 浏览
深入理解 GPU Tensor Core 架构与 CUDA 编程实战:从 Ampere 到 Blackwell 的 AI 高性能计算 从工业级 AI 计算的视角,系统性梳理 NVIDIA Tensor Core 的架构演进(Volta→Ampere→Hopper→Blackwell),深入讲解 CUDA WMMA API、Hopper TMA 异步拷贝、Warp Group wgmma 指令、共享内存 Swizzle、多级流水线设计,并提供 FP8 混合精度 GEMM 内核实战案例与 Nsight Compute 性能剖析指南。 GPU并行计算 2026年10月02日 0 点赞 0 评论 44 浏览
WebGPU 通用计算:GPU 并行计算模式实战 系统掌握WebGPU通用计算中的核心并行模式:归约、前缀和、直方图、基数排序、SpMV,附带完整WGSL实现与性能分析 GPU并行计算 2026年10月02日 0 点赞 0 评论 51 浏览
GPU-optimized AI, Machine Learning, & HPC Software | NVIDIA NGC 影音娱乐 GPU并行计算 2026年10月01日 0 点赞 0 评论 23 浏览
Rust + CUDA IPC:多 GPU 间零拷贝张量通信工程实战 大规模 AI 模型训练与推理离不开多 GPU 协作。本文深入讲解 CUDA IPC 机制如何实现在同一节点内多 GPU 间零拷贝张量传递,并通过 Rust FFI 绑定给出完整工程实现,覆盖内存共享模型、事件同步、NVLink 拓扑感知、错误处理与 NCCL 集成。 GPU并行计算 2026年09月30日 0 点赞 0 评论 57 浏览
Multi-Tenant GPU Scheduling in Production: From Time-Slicing to MIG and Beyond 深度解析多租户 GPU 调度三大模型(Time-Slicing、MIG、vGPU)的原理、生产级实现与选型策略,含完整 Kubernetes 部署示例和性能基准对比。 GPU并行计算 2026年09月30日 0 点赞 0 评论 52 浏览