NVIDIA TensorRT-LLM 深度工程实战:从图编译到千卡集群的 LLM 推理系统设计 深入剖析 NVIDIA TensorRT-LLM 的架构设计与生产实践,从底层图编译优化到多机多机推理的完整方案,涵盖算子融合、CUDA Graph 捕获、Paged KV Cache、FP8 量化及 Disaggregated Serving 等核心技术,附完整代码示例。 推理部署 2026年10月04日 0 点赞 0 评论 75 浏览
模型量化实战:从 AWQ/GPTQ 到 NVIDIA FP8 推理的工程部署与性能调优 深度剖析大语言模型推理中的量化技术路线,从 GPTQ、AWQ、SmoothQuant 到 NVIDIA 硬件级 FP8 推理,结合 vLLM 与 TensorRT-LLM 实战部署,给出一套完整的工程方案。 服务器运维 2026年10月07日 0 点赞 0 评论 28 浏览
NVIDIA NVFP4 与 Micro-Scaling:Blackwell 推理 4-bit 浮点精度的深度工程实战 系统拆解 NVIDIA Blackwell 第五代 Tensor Core 原生支持的 NVFP4(E2M1 4-bit 浮点)与 Micro-Scaling 两级缩放格式:从位级定义、缩放数学、离群点校准(旋转变换/重要性矩阵)、Scaled GEMM 内核实现,到混合精度分层策略与生产部署陷阱清单,给出在显存与带宽受限的推理集群上把单卡吞吐推向极限的工程方法。 工程实践 2026年10月07日 0 点赞 0 评论 17 浏览
大模型推理部署:从vLLM到TensorRT-LLM的高性能服务化 深度解析大模型推理部署的核心技术,涵盖显存优化、推理引擎对比和性能指标体系 推理部署 2026年10月10日 0 点赞 0 评论 12 浏览