雅可比矩阵
雅可比矩阵把多输入、多输出函数的一阶偏导数组织成矩阵,是高维函数的局部线性映射,也是理解神经网络链式法则与反向传播的关键。
雅可比矩阵把多输入、多输出函数的一阶偏导数组织成矩阵,是高维函数的局部线性映射,也是理解神经网络链式法则与反向传播的关键。
梳理 Feed Forward 的基本含义、Transformer 中 FFN 与 Attention 的分工,并从 ReLU、SiLU、GLU 逐步推导到 SwiGLU。
从残差连接、梯度传播、信息保留到 LayerNorm 的计算、可学习参数及其与 BatchNorm 的区别,系统理解 Transformer 中的 Add & Norm。
Softmax 的优化既要解决指数运算的数值稳定性,也要减少显存读写,并为 Attention 与 FlashAttention 的融合计算打下基础。
RoPE 分别为 Query 和 Key 编入绝对位置,并利用旋转矩阵的内积性质,让注意力分数自然只依赖相对位置。
泰勒公式把函数在某一点附近的局部行为编码进一个多项式。本文推导系数来源,解释余项与收敛条件,并整理常见展开式和应用方法。
Tokenizer 不只是切词:它要在词表大小、序列长度、开放词汇与多语言覆盖之间权衡。本文用例子和一份可运行的 BPE 实现讲清主流算法。
DFlash 的关键并不只是增加模型层数,而是把跨 token 的串行草稿改造成一次前向中的块级并行预测。