LLM 推理引擎内部原理:PagedAttention、Continuous Batching 与现代推理架构剖析 深入剖析现代 LLM 推理引擎的核心机制——PagedAttention 内存管理和 Continuous Batching 调度策略,揭示 vLLM 如何将吞吐量提升 2-4 倍 推理部署 2026年09月29日 0 点赞 0 评论 59 浏览
Linux 内核进程调度器深度剖析:从 CFS 红黑树到 EEVDF 算法的完整工程实践 深入剖析 Linux 内核进程调度器的设计哲学与算法演进:从 CFS 的虚拟运行时间机制、红黑树数据结构,到 EEVDF 的最早虚拟截止时间优先算法,详解调度器的公平性与延迟权衡、NUMA 感知优化、实时调度类,以及性能调优实践。 进程调度 2026年10月03日 0 点赞 0 评论 64 浏览
Linux 内核 SCHED_DEADLINE 深度实战:从 EDF 算法到 AI 推理延迟 SLA SCHED_DEADLINE 作为 Linux 内核唯一基于全局最早截止时间优先(EDF)+ 带宽隔离(CBS)的实时调度类,正在成为 AI 推理服务、实时音视频处理的首选调度策略。本文从内核源码出发解析 CBS 算法实现与生产调优方法论。 Linux内核 2026年10月05日 0 点赞 0 评论 41 浏览
Linux内核内存管理机制深度解析:从伙伴系统到页面回收 深入剖析Linux内核内存管理完整架构,涵盖伙伴系统、页表映射、SLUB分配器、LRU算法、OOM Killer机制及实战调优 内存管理 2026年10月07日 0 点赞 0 评论 35 浏览
io_uring 注册事件描述符与跨环通信机制(IORING_REGISTER_RING_FDS)— 下一代多核 IO 数据面协同设计 深度解析 Linux io_uring IORING_REGISTER_RING_FDS 注册事件描述符与跨环通信机制,涵盖三种注册模式、IORING_OP_MSG_RING 零陷入跨环投递原语、四核负载均衡器实战代码,以及性能对比与生产部署建议。 文件系统 2026年10月07日 0 点赞 0 评论 32 浏览
Linux Kernel PSI 深度解析:从内核压力信号到 AI 推理 QoS 与自动弹性伸缩 深入Linux内核PSI(Pressure Stall Information)机制,从内核任务停滞时间统计到cgroup2 per-cgroup压力视图,结合BPF程序跟踪压力事件,构建AI推理服务的自动弹性伸缩方案 Linux内核 2026年10月07日 0 点赞 0 评论 24 浏览