量化基本概念
量化不是简单地把浮点数改成整数,而是在有限离散值中近似权重和激活。本文系统梳理 scale、zero point、对称量化、INT8 矩阵乘法与量化评估。
量化不是简单地把浮点数改成整数,而是在有限离散值中近似权重和激活。本文系统梳理 scale、zero point、对称量化、INT8 矩阵乘法与量化评估。
config.json 不只是模型加载配置:从层数、隐藏维度、注意力头、上下文长度和精度字段,可以还原 Llama 2 7B 的网络结构并估算推理资源。
系统梳理 Self-Attention 的输入、QKV 投影、注意力权重与因果掩码,并从矩阵变化解释增量解码为何只计算最后一行、为何缓存 K 和 V。
为什么原始 Transformer 的 Decoder 有两层注意力,而 GPT、Qwen 等 decoder-only 模型通常只有一类注意力?本文从信息流和矩阵形状出发梳理 Transformer 结构。
雅可比矩阵把多输入、多输出函数的一阶偏导数组织成矩阵,是高维函数的局部线性映射,也是理解神经网络链式法则与反向传播的关键。
梳理 Feed Forward 的基本含义、Transformer 中 FFN 与 Attention 的分工,并从 ReLU、SiLU、GLU 逐步推导到 SwiGLU。
从残差连接、梯度传播、信息保留到 LayerNorm 的计算、可学习参数及其与 BatchNorm 的区别,系统理解 Transformer 中的 Add & Norm。
Softmax 的优化既要解决指数运算的数值稳定性,也要减少显存读写,并为 Attention 与 FlashAttention 的融合计算打下基础。