人工智能

残差连接深度实战:从退化问题与恒等映射、残差流到 Pre-LN 与深度初始化工程

系统拆解残差连接的第一性原理:为何 plain 网络会退化、恒等映射 y=F(x)+x 如何在反向传播中保留永不消失的梯度高速通道(∂L/∂x = ∂L/∂y·(∂F/∂x + I)),并从机制可解释性视角解读 Transformer 的残差流(注意力/MLP 只是写入主干的低秩扰动);深入 Pre-LN 与 Post-LN 的稳定性对比、ReZero/SkipInit/Fixup/LayerScale/DeepNorm 等深度初始化技巧、混合精度下残差累加的数值稳定性,给出可切换 Pre/Post-LN 的生产级 PyTorch 实现与生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力、学习率调度共同构成 Transformer 内部机制与训练工程深度解系列。

学习率调度深度实战:从 Warmup、Cosine 退火到 WSD 与线性缩放律的大批量预训练工程

系统拆解学习率调度的第一性原理:为什么 LR 主宰优化轨迹与泛化(flat/sharp minima),从恒定与阶梯衰减的朴素基线,到线性/常数/余弦三种 Warmup 的动力学成因,再到 Cosine 退火、SGDR 与现代化大模型预训练范式 Warmup-Stable-Decay(WSD),并深入线性缩放律与 Accumulated Warmup 修正、与梯度累积/混合精度/梯度裁剪的交互陷阱,给出可复用的 PyTorch 组合调度器与生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力共同构成 Transformer 内部机制与训练工程深度解系列。

交叉注意力深度实战:从编码器-解码器对齐、KV 投影到多模态融合与流式解码工程

系统拆解交叉注意力的第一性原理:Q 来自解码端、K/V 来自编码端,从 Bahdanau 加性注意力、Luong 乘性注意力到现代缩放点积交叉注意力,亲手实现一个生产级 CrossAttention 模块,并深入多模态融合(Whisper/视觉-语言/Perceiver)、流式解码的 cross KV 缓存复用、FlashAttention 适配与生产陷阱清单,与本站 RMSNorm、相对位置编码共同构成 Transformer 内部机制深度解三部曲。