全栈开发

GRPO 后训练系统工程实战:从 RLHF 偏好建模到可验证奖励的全链路架构

拆解 GRPO 后训练系统的工程内核:PPO Critic 为何在 LLM 场景失效、组内基线归一化与零标准差组的语义处理、token 级损失归一化如何消除长度偏置、可验证奖励(RLVR)与沙箱判定器设计、rollout-colocate 架构下的权重重分片与 logprob 对拍,附损失实现、verl 配置与生产坑位清单。

CHERI:硬件能力指针与内存安全的架构革命

从剑桥大学学术研究到ARM Morello真实硅片,CHERI (Capability Hardware Enhanced RISC Instructions) 正在硬件层面重新定义内存安全的边界。本文深入解析CHERI的capability指针机制、CHERI C语言扩展、CheriBSD实战部署,以及与其他安全扩展(MTE、BTI、PAC)的对比分析。