ARTICLE ARCHIVE

文章归档

汇总全站文章,按发布时间由近及远排列,并通过分页浏览全部历史内容。
模型推理

Optimal Brain Surgeon(OBS):带补偿的二阶剪枝方法

OBS 相比 OBD 的关键区别在于补偿:删除某个权重以后,它允许其他权重沿着 Hessian 给出的二阶曲率方向共同调整,从而尽量降低剪枝带来的损失增量。

2026 年 08 月 10 日 · 6 分钟 · 2557 字 · Ge Zhang
LeetCode

1. 两数之和

两数之和可以用哈希表在一次遍历中完成:遍历当前数字时,查找 target - 当前值是否已经出现,若存在就返回两个下标。

2026 年 08 月 08 日 · 2 分钟 · 727 字 · Ge Zhang
模型推理

Optimal Brain Damage(OBD):用 Hessian 判断权重重要性

权重绝对值小不等于权重不重要。OBD 使用 Hessian 对角元素衡量损失对各权重方向的曲率,以二阶显著性分数选择删除后损失增加最小的权重。

2026 年 07 月 29 日 · 11 分钟 · 5253 字 · Ge Zhang
模型推理

量化基本概念

量化不是简单地把浮点数改成整数,而是在有限离散值中近似权重和激活。本文系统梳理 scale、zero point、对称量化、INT8 矩阵乘法与量化评估。

2026 年 07 月 28 日 · 19 分钟 · 9200 字 · Ge Zhang
模型推理

大模型量化粒度详解:逐层、逐通道与逐组量化

量化粒度决定多少个权重共享一套量化参数。本文通过一个 4×8 权重矩阵,逐步推导逐层、逐通道与逐组量化的公式、误差、优缺点和适用场景。

2026 年 07 月 28 日 · 6 分钟 · 2572 字 · Ge Zhang
模型推理

从 config.json 读懂 Llama 2 7B

config.json 不只是模型加载配置:从层数、隐藏维度、注意力头、上下文长度和精度字段,可以还原 Llama 2 7B 的网络结构并估算推理资源。

2026 年 07 月 24 日 · 9 分钟 · 4152 字 · Ge Zhang
数学知识

雅可比矩阵

雅可比矩阵把多输入、多输出函数的一阶偏导数组织成矩阵,是高维函数的局部线性映射,也是理解神经网络链式法则与反向传播的关键。

2026 年 07 月 23 日 · 5 分钟 · 2150 字 · Ge Zhang
AI 基础原理

transformer结构

为什么原始 Transformer 的 Decoder 有两层注意力,而 GPT、Qwen 等 decoder-only 模型通常只有一类注意力?本文从信息流和矩阵形状出发梳理 Transformer 结构。

2026 年 07 月 23 日 · 8 分钟 · 3721 字 · Ge Zhang
AI 基础原理

self-attention

系统梳理 Self-Attention 的输入、QKV 投影、注意力权重与因果掩码,并从矩阵变化解释增量解码为何只计算最后一行、为何缓存 K 和 V。

2026 年 07 月 23 日 · 7 分钟 · 3416 字 · Ge Zhang
AI 基础原理

FeedForward

梳理 Feed Forward 的基本含义、Transformer 中 FFN 与 Attention 的分工,并从 ReLU、SiLU、GLU 逐步推导到 SwiGLU。

2026 年 07 月 21 日 · 7 分钟 · 3331 字 · Ge Zhang