self-attention

系统梳理 Self-Attention 的输入、QKV 投影、注意力权重与因果掩码,并从矩阵变化解释增量解码为何只计算最后一行、为何缓存 K 和 V。

2026 年 07 月 23 日 · 7 分钟 · 3416 字 · Ge Zhang

transformer结构

为什么原始 Transformer 的 Decoder 有两层注意力,而 GPT、Qwen 等 decoder-only 模型通常只有一类注意力?本文从信息流和矩阵形状出发梳理 Transformer 结构。

2026 年 07 月 23 日 · 8 分钟 · 3721 字 · Ge Zhang

FeedForward

梳理 Feed Forward 的基本含义、Transformer 中 FFN 与 Attention 的分工,并从 ReLU、SiLU、GLU 逐步推导到 SwiGLU。

2026 年 07 月 21 日 · 7 分钟 · 3331 字 · Ge Zhang

Add&LayerNorm

从残差连接、梯度传播、信息保留到 LayerNorm 的计算、可学习参数及其与 BatchNorm 的区别,系统理解 Transformer 中的 Add & Norm。

2026 年 07 月 20 日 · 7 分钟 · 3213 字 · Ge Zhang

softmax的优化

Softmax 的优化既要解决指数运算的数值稳定性,也要减少显存读写,并为 Attention 与 FlashAttention 的融合计算打下基础。

2026 年 07 月 20 日 · 7 分钟 · 3101 字 · Ge Zhang

RoPE 旋转位置编码:从绝对位置到相对位置

RoPE 分别为 Query 和 Key 编入绝对位置,并利用旋转矩阵的内积性质,让注意力分数自然只依赖相对位置。

2026 年 07 月 17 日 · 9 分钟 · 4345 字 · Ge Zhang

Tokenizer 基础:从文本到 Token ID

Tokenizer 不只是切词:它要在词表大小、序列长度、开放词汇与多语言覆盖之间权衡。本文用例子和一份可运行的 BPE 实现讲清主流算法。

2026 年 07 月 15 日 · 10 分钟 · 4689 字 · Ge Zhang