推理引擎的编译优化:从计算图到高效执行 深入解析现代推理引擎的编译优化技术:计算图IR、算子融合策略、常量折叠、静态内存规划、CUDA Graph捕获和调度并行,涵盖TensorRT-LLM、vLLM、llama.cpp等主流引擎的编译实践。 编译原理 2026年09月30日 0 点赞 0 评论 51 浏览
MLIR 编译器基础设施:多级中间表示与 AI/ML 系统编译的全栈工程 MLIR 通过可组合方言体系解决传统编译器的语义下降悬崖问题,成为 TensorFlow/XLA、PyTorch inductor、oneAPI、Triton 等 AI 基础设施核心编译层。本文深入 MLIR 设计哲学、核心方言体系、Lowering 流水线、Pass 基础设施,并提供自定义 Pass 开发和 NPU 优化实战案例。 编译原理 2026年10月07日 0 点赞 0 评论 26 浏览