RDMA 深度工程实战:从 Verbs 内存语义到 AI 训练集群零拷贝网络的全栈实践 从 Verbs 对象模型出发,完整拆解 RDMA 的 PD/MR/QP/CQ 体系与 RC 连接状态机,给出可运行的单边写与立即数通知代码,并深入内存注册成本、DCQCN 拥塞控制、PFC 死锁、GPUDirect RDMA 与 NCCL Ring AllReduce 工程实践,最后给出生产避坑清单。 全栈开发 2026年09月29日 0 点赞 0 评论 50 浏览
深入 GPUDirect RDMA:GPU 与网卡之间的零拷贝数据通路深度工程实战 深入解析 GPUDirect RDMA 技术栈:从 PCIe P2P 通信、IOMMU/SVA 机制、nvidia-peermem 内核模块到 NCCL RDMA 路径实现,完整呈现 GPU 与网卡零拷贝数据通路的工程全貌与生产调优实践。 工程实践 2026年09月30日 0 点赞 0 评论 54 浏览
深入理解 Ring AllReduce:分布式训练通信优化的理论与实践 从底层原理到工程实践,深入剖析 Ring AllReduce 算法机制及 DeepSpeed ZeRO-DP 参数分片策略,提供千卡集群训练可落地的通信优化指南 分布式系统 2026年10月02日 0 点赞 0 评论 66 浏览
RDMA 编程实战:从 Verbs API 到零拷贝分布式系统架构 RDMA编程深度实战:从Verbs API到零拷贝分布式系统架构。涵盖RDMA核心概念、QP状态机、批量提交与Doorbell优化、ODP内存管理、内存窗口与FMR策略,以及NCCL在AI训练集群中的RDMA传输层原理,配套完整C语言代码示例。 分布式系统 2026年10月03日 0 点赞 0 评论 70 浏览
NCCL 多 GPU 通信优化:Ring AllReduce 与 Tree AllReduce 算法深度工程实战 深入剖析 NCCL 中 Ring AllReduce、Tree AllReduce、Ring Tree Hybrid 三种核心算法的实现原理、带宽模型与拓扑自适应策略,结合多卡集群部署的性能调优案例,揭示如何在一机多卡、多机多卡场景下实现接近线性的扩展效率。 算法与数据结构 2026年10月06日 0 点赞 0 评论 42 浏览
GPUDirect RDMA:AI 推理集群零拷贝网络传输的工程实践 深入解析 GPUDirect RDMA 架构原理与 AI 推理集群工程实践,涵盖内核驱动实现、CUDA API 集成、NCCL RDMA 通道建立、性能调优与生产级容错设计 分布式系统 2026年10月06日 0 点赞 0 评论 32 浏览
RoCE v2 拥塞控制深度剖析:DCQCN、ETS、PFC 联动调优 AI 分布式训练网络 深度解析 RoCE v2 拥塞控制完整体系:从 PFC 反压到 ECN 标记,再到 DCQCN 硬件速率调节,以及如何联合调优适配 AI 训练流量特征。涵盖 Incast 分析、交换机阈值公式、DCQCN 参数实战、TIMELY/HPCC 演进路线。 分布式系统 2026年10月07日 0 点赞 0 评论 25 浏览