RLHF

Agent治理与对齐工程:从意图对齐到生产级治理框架的系统化构建

系统讲解Agent治理与对齐工程:从LLM对齐技术(RLHF/DPO/Constitutional AI)到可执行行为约束(规则引擎/动态监控/工具治理)、可解释性架构(推理追踪/决策透明)、审计合规(行为/质量/影响/合规)、组织级治理架构(三道防线/生命周期治理)、对齐深层挑战(古德哈特定律/局限性)。

GRPO 后训练系统工程实战:从 RLHF 偏好建模到可验证奖励的全链路架构

拆解 GRPO 后训练系统的工程内核:PPO Critic 为何在 LLM 场景失效、组内基线归一化与零标准差组的语义处理、token 级损失归一化如何消除长度偏置、可验证奖励(RLVR)与沙箱判定器设计、rollout-colocate 架构下的权重重分片与 logprob 对拍,附损失实现、verl 配置与生产坑位清单。

LLM 推理确定性工程深度实战:从浮点非结合性、Batch 不变性到可复现 Kernel 的全链路解法

拆解 LLM 推理不确定性的三个根因——浮点加法非结合性、split-k 与浮点 atomicAdd 的非确定累积、Continuous Batching 导致的 batch invariance 破缺;给出 PyTorch 复现脚本、Triton batch-invariant kernel、CUB 确定性归约与 CUBLAS_WORKSPACE_CONFIG 配置要点,分析 RL 后训练 on-policy 偏差与合规审计场景,量化 15%-30% 的性能代价并给出生产落地检查清单。