Transformer

RoPE 旋转位置编码深度工程实战:从复数旋转不变性、NTK/YaRN 长上下文外推到生产级上下文扩展

拆解 RoPE 旋转位置编码的数学本质(复数旋转与相对位置恒等式)与工程实现(rotate_half、fp32 相位精度、cache 复用),分析长度外推崩塌的真实机理(低频欠训练 + 高频 OOD),对比 PI / NTK-aware / YaRN / LongRoPE 四类修补方案,给出可运行的频率重映射代码、注意力温度补偿写法与 needle-in-haystack 评测骨架,并总结 GQA、Tensor Parallel、chunked prefill、mrope 多模态等六个生产落地陷阱。

RMSNorm 深度实战:从 LayerNorm 的协方差偏移到 FP8 融合 Kernel 的数值稳定性工程

当你打开 LLaMA、Qwen、DeepSeek、Gemma 或 Mistral 任意一份模型配置文件时,几乎都会看到同一行:`"norm_type": "rms_norm"`。RMSNorm(Root Mean Square Normalization)已经成为现代大语言模型事实上的默认归一化层,取代了 Transformer 原始论文中使用的 LayerNorm。但绝大多数工程实现只是把它当作…

相对位置编码深度实战:从绝对位置嵌入、T5 相对注意力、ALiBi 到 DeBERTa 解耦位置表示

Transformer 的自注意力对 token 顺序是**置换不变**的:把输入序列打乱,注意力矩阵只会在行/列上跟着重排,输出集合不变。这意味着如果不显式注入顺序信号,模型看到 "猫 吃 鱼" 与 "鱼 吃 猫" 会得到完全相同的语义表征——这在实际任务里是灾难。

交叉注意力深度实战:从编码器-解码器对齐、KV 投影到多模态融合与流式解码工程

系统拆解交叉注意力的第一性原理:Q 来自解码端、K/V 来自编码端,从 Bahdanau 加性注意力、Luong 乘性注意力到现代缩放点积交叉注意力,亲手实现一个生产级 CrossAttention 模块,并深入多模态融合(Whisper/视觉-语言/Perceiver)、流式解码的 cross KV 缓存复用、FlashAttention 适配与生产陷阱清单,与本站 RMSNorm、相对位置编码共同构成 Transformer 内部机制深度解三部曲。

激活函数深度实战:从 ReLU、GELU 的数值稳定性到 SwiGLU / GeGLU 与融合 Kernel 的生产工程

系统拆解激活函数的第一性原理:为什么非线性不可或缺、ReLU 的死亡神经元问题与改进族(LeakyReLU/ELU/SELU),GELU 精确版与 tanh/sigmoid 近似的数值稳定性权衡,再到 SwiGLU/GeGLU 门控线性单元取代 GELU-then-Linear 的设计哲学与维度对齐约束,并深入低精度(FP8)下激活行为差异、GELU exact/approx 混用陷阱与融合 Kernel 工程,给出可复用的 PyTorch 参考实现与 9 项生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力、残差连接、学习率调度、梯度累积、词嵌入共同构成 Transformer 内部机制与训练工程深度解系列(补全 FFN 块最后一环)。

FlashAttention 算法深度解析:从 IO-Aware 优化到 GPU 硬件极致

FlashAttention 通过 IO-Aware 的 Tiling + Recomputation 策略,将 Self-Attention 的 HBM 访问复杂度从 O(N²) 降至 O(N²/d),在不牺牲数学精度的前提下实现 2-4× 端到端训练加速。本文深入推导 Online Softmax 数学基础、解析 FlashAttention/2/3 三代算法演进、剖析 Hopper/Tensor Core 适配优化,并给出一套完整的工程性能分析框架。