NVIDIA CUDA Toolkit 12.5 版本要点:兼容性与库更新 总结 CUDA 12.5 的发布要点,包括驱动兼容策略、安装定制与数学函数精度说明,以及库层更新与弃用提示。 GPU并行计算 2026年04月30日 0 点赞 0 评论 191 浏览
KServe 推理服务自动伸缩与 GPU 调度治理(2025) # KServe 推理服务自动伸缩与 GPU 调度治理(2025)## 一、架构与部署- 模型服务:`InferenceService` 定义接口与路由;支持 REST/gRPC。- 资源:为 `GPU` 设置 requests/limits 与节点选择器;隔离不同模型的资源。- 存储:模型拉取与缓存策略,减少启动时延。## 二、自动伸缩与队列- Autoscaling:按 QPS GPU并行计算 2026年04月30日 0 点赞 0 评论 126 浏览
WebGPU与计算着色器:从图形管线到GPGPU通用计算 WebGPU核心技术解析,包括GPUDevice架构、计算着色器基础、GPGPU实战案例及浏览器内AI推理部署 GPU并行计算 2026年09月21日 0 点赞 0 评论 62 浏览
从零微调你的第一个大语言模型:LoRA 与 QLoRA 在消费级显卡上的完整实践指南 从 LoRA 的低秩分解数学原理到 QLoRA 的 4-bit 量化技术,手把手教你用 RTX 3060/4060 微调 7B 大模型。包含完整 Python 代码、显存优化技巧与生产级 vLLM 部署方案。 GPU并行计算 2026年09月19日 0 点赞 0 评论 60 浏览
Rust + CUDA IPC:多 GPU 间零拷贝张量通信工程实战 大规模 AI 模型训练与推理离不开多 GPU 协作。本文深入讲解 CUDA IPC 机制如何实现在同一节点内多 GPU 间零拷贝张量传递,并通过 Rust FFI 绑定给出完整工程实现,覆盖内存共享模型、事件同步、NVLink 拓扑感知、错误处理与 NCCL 集成。 GPU并行计算 2026年09月30日 0 点赞 0 评论 57 浏览
CUDA Warp 编程深度实战:从 Bank Conflict 到 Tensor Core 极限优化 深入NVIDIA GPU Warp级并行机制,从Bank Conflict原理到Tensor Core极限优化,涵盖Shared Memory架构、Warp分支发散、FP16矩阵乘实战案例及NSight Compute性能分析 GPU并行计算 2026年09月29日 0 点赞 0 评论 57 浏览
从零编写 GPU 驱动:Asahi Linux AGX 架构与 Apple M 系列图形栈逆向工程 Asahi Linux从零开始为Apple M系列芯片编写GPU驱动的工程实践,涵盖逆向工程方法论、Rust驱动架构、统一地址空间管理、命令缓冲区调度等深度内容 GPU并行计算 2026年10月03日 0 点赞 0 评论 56 浏览
Multi-Tenant GPU Scheduling in Production: From Time-Slicing to MIG and Beyond 深度解析多租户 GPU 调度三大模型(Time-Slicing、MIG、vGPU)的原理、生产级实现与选型策略,含完整 Kubernetes 部署示例和性能基准对比。 GPU并行计算 2026年09月30日 0 点赞 0 评论 52 浏览
SYCL/oneAPI 异构计算编程模型:从 CUDA 锁定到跨平台 GPU 编程的实战突围 深入解析 SYCL 2020 标准的核心抽象(buffer/accessor、ND-Range、USM),对比 CUDA 生态的差异与优势,并通过生产级推理引擎集成案例展示如何在 NVIDIA/AMD/Intel 三大平台上用一套代码完成高性能 GEMM 计算。包含 sub-group shuffle、双队列 pipeline、AdaptiveCpp 单一源码多后端的实战技巧,以及 ResNet-50 跨平台性能基准数据。 GPU并行计算 2026年10月02日 0 点赞 0 评论 51 浏览
WebGPU 通用计算:GPU 并行计算模式实战 系统掌握WebGPU通用计算中的核心并行模式:归约、前缀和、直方图、基数排序、SpMV,附带完整WGSL实现与性能分析 GPU并行计算 2026年10月02日 0 点赞 0 评论 51 浏览
WebGPU 实战:浏览器内并行计算的全新时代 — 从 Compute Shader 到 ML 推理的 GPGPU 革命 WebGPU实战权威指南:从计算着色器原理到浏览器内ML推理的完整实现路径。涵盖WGSL着色器、矩阵乘法性能基准、图像超分辨率项目实战及渐进增强部署策略。 GPU并行计算 2026年09月19日 0 点赞 0 评论 50 浏览
GPU计算着色器与线程组执行模型深度解析:从SIMT波前调度到共享内存库冲突优化的GPU并行计算架构 从硬件视角解析GPU SIMT执行模型、线程层级、共享内存Bank冲突优化及内存合并访问策略。 GPU并行计算 2026年09月21日 0 点赞 0 评论 47 浏览
GPU计算生态深度实战:从CUDA到异构计算的编程模型与工程实践 从GPU硬件架构出发,深入剖析CUDA编程模型的底层原理,探讨内存层次优化、线程调度机制,并对比分析HIP、SYCL等开放生态替代方案,介绍基于CXL和池化的GPU资源调度前沿实践。 GPU并行计算 2026年09月30日 0 点赞 0 评论 45 浏览
深入理解 GPU Tensor Core 架构与 CUDA 编程实战:从 Ampere 到 Blackwell 的 AI 高性能计算 从工业级 AI 计算的视角,系统性梳理 NVIDIA Tensor Core 的架构演进(Volta→Ampere→Hopper→Blackwell),深入讲解 CUDA WMMA API、Hopper TMA 异步拷贝、Warp Group wgmma 指令、共享内存 Swizzle、多级流水线设计,并提供 FP8 混合精度 GEMM 内核实战案例与 Nsight Compute 性能剖析指南。 GPU并行计算 2026年10月02日 0 点赞 0 评论 44 浏览
TritonNext 2026与FlagOS生态:AI算子编程的"通用语"如何打破CUDA垄断 深度解析TritonNext 2026技术大会与FlagOS v1.6开源AI编译器生态,涵盖Triton编程语言演进、AI驱动算子生成、异构芯片适配突破等前沿技术 GPU并行计算 2026年09月24日 0 点赞 0 评论 40 浏览