异构计算

ARM SME2 可扩展矩阵扩展:AI推理的下一代硬件加速引擎

ARM SME2(Scalable Matrix Extension 2)是ARMv9.4-A架构的核心扩展,首次引入二维ZTile矩阵寄存器和FMOPA外积累加指令,使通用CPU具备与入门级GPU竞争的INT8/BF16矩阵运算能力。本文深入解析SME2硬件架构、编程模型、LLM推理工程实践以及性能实测数据。

Linux内核DMA-BUF显式同步与跨驱动缓冲区共享:从零构建零拷贝GPU计算管线

在现代AI推理管线中,数据搬运的耗时往往超过计算本身。CPU与GPU、GPU与GPU、存储与加速器之间的零拷贝数据共享,是突破性能瓶颈的关键。Linux内核的DMA-BUF子系统正是解决这一问题的核心基础设施,而显式同步机制(explicit fencing)则是保证多设备并发访问正确性的基石。本文将深入DMA-BUF的内部机制,从零实现一个跨驱动的零拷贝GPU计算管线。

SYCL/oneAPI 异构计算编程模型:从 CUDA 锁定到跨平台 GPU 编程的实战突围

深入解析 SYCL 2020 标准的核心抽象(buffer/accessor、ND-Range、USM),对比 CUDA 生态的差异与优势,并通过生产级推理引擎集成案例展示如何在 NVIDIA/AMD/Intel 三大平台上用一套代码完成高性能 GEMM 计算。包含 sub-group shuffle、双队列 pipeline、AdaptiveCpp 单一源码多后端的实战技巧,以及 ResNet-50 跨平台性能基准数据。