RDMA 深度工程实战:从 Verbs 内存语义到 AI 训练集群零拷贝网络的全栈实践 从 Verbs 对象模型出发,完整拆解 RDMA 的 PD/MR/QP/CQ 体系与 RC 连接状态机,给出可运行的单边写与立即数通知代码,并深入内存注册成本、DCQCN 拥塞控制、PFC 死锁、GPUDirect RDMA 与 NCCL Ring AllReduce 工程实践,最后给出生产避坑清单。 全栈开发 2026年09月29日 0 点赞 0 评论 50 浏览
深入 GPUDirect RDMA:GPU 与网卡之间的零拷贝数据通路深度工程实战 深入解析 GPUDirect RDMA 技术栈:从 PCIe P2P 通信、IOMMU/SVA 机制、nvidia-peermem 内核模块到 NCCL RDMA 路径实现,完整呈现 GPU 与网卡零拷贝数据通路的工程全貌与生产调优实践。 工程实践 2026年09月30日 0 点赞 0 评论 54 浏览
RDMA 高性能网络编程实战:从零构建 RoCE v2 数据中心通信层 深入 RDMA 编程核心机制——QP状态机、单边RDMA WRITE、GPUDirect RDMA、RoCE v2拥塞控制(PFC/DCQCN),基于libibverbs API从零构建生产级通信层,含完整代码示例与性能调优实战。 网络技术 2026年10月04日 0 点赞 0 评论 36 浏览
CPU-GPU 异构统一虚拟内存系统:AI 大规模训练的核心基础设施 深入解析 CPU-GPU 统一虚拟内存系统(CUDA Unified Memory + Linux HMM)的工作原理与实战优化,涵盖 page fault 机制、CUDA VMM API、GPUDirect RDMA/Storage、分页模型参数存储、内存 Advice 与 TLB 优化等 AI 训练核心基础设施技术。 操作系统 2026年10月05日 0 点赞 0 评论 32 浏览
GPUDirect RDMA:AI 推理集群零拷贝网络传输的工程实践 深入解析 GPUDirect RDMA 架构原理与 AI 推理集群工程实践,涵盖内核驱动实现、CUDA API 集成、NCCL RDMA 通道建立、性能调优与生产级容错设计 分布式系统 2026年10月06日 0 点赞 0 评论 32 浏览
Linux内核PCIe子系统深度工程实战:从设备枚举到SR-IOV虚拟化与生产性能调优 深度剖析Linux内核PCIe子系统:PCIe协议三层模型与拓扑枚举流程,pci_dev/pci_bus核心数据结构,BAR配置与64位内存映射,MSI/MSI-X中断与亲和性,DMA三种映射类型与IOMMU隔离,ASPM电源管理与延迟权衡,AER错误分类与生产监控,SR-IOV虚拟化与VFIO直通,NTB/GPUDirect P2P通信,生产环境链路训练/中断风暴/NUMA优化三大案例,PCIe Gen6/CXL未来趋势 Linux内核 2026年10月09日 0 点赞 0 评论 16 浏览