GPU并行计算

KServe 推理服务自动伸缩与 GPU 调度治理(2025)

# KServe 推理服务自动伸缩与 GPU 调度治理(2025)## 一、架构与部署- 模型服务:`InferenceService` 定义接口与路由;支持 REST/gRPC。- 资源:为 `GPU` 设置 requests/limits 与节点选择器;隔离不同模型的资源。- 存储:模型拉取与缓存策略,减少启动时延。## 二、自动伸缩与队列- Autoscaling:按 QPS

FlashAttention 算法深度解析:从 IO-Aware 优化到 GPU 硬件极致

FlashAttention 通过 IO-Aware 的 Tiling + Recomputation 策略,将 Self-Attention 的 HBM 访问复杂度从 O(N²) 降至 O(N²/d),在不牺牲数学精度的前提下实现 2-4× 端到端训练加速。本文深入推导 Online Softmax 数学基础、解析 FlashAttention/2/3 三代算法演进、剖析 Hopper/Tensor Core 适配优化,并给出一套完整的工程性能分析框架。

SYCL/oneAPI 异构计算编程模型:从 CUDA 锁定到跨平台 GPU 编程的实战突围

深入解析 SYCL 2020 标准的核心抽象(buffer/accessor、ND-Range、USM),对比 CUDA 生态的差异与优势,并通过生产级推理引擎集成案例展示如何在 NVIDIA/AMD/Intel 三大平台上用一套代码完成高性能 GEMM 计算。包含 sub-group shuffle、双队列 pipeline、AdaptiveCpp 单一源码多后端的实战技巧,以及 ResNet-50 跨平台性能基准数据。

深入理解 GPU Tensor Core 架构与 CUDA 编程实战:从 Ampere 到 Blackwell 的 AI 高性能计算

从工业级 AI 计算的视角,系统性梳理 NVIDIA Tensor Core 的架构演进(Volta→Ampere→Hopper→Blackwell),深入讲解 CUDA WMMA API、Hopper TMA 异步拷贝、Warp Group wgmma 指令、共享内存 Swizzle、多级流水线设计,并提供 FP8 混合精度 GEMM 内核实战案例与 Nsight Compute 性能剖析指南。