从 Padding 到 Continuous Batching:LLM 推理中的长度感知调度

长度感知调度不只是在组批前按长度分桶,还要同时控制请求组合、每轮 Token 预算、变长数据布局以及请求的动态进出。

2026 年 10 月 08 日 · 9 分钟 · 4212 字 · Ge Zhang

从零理解 Speculative Decoding:原理、拒绝采样与技术演进

最经典的投机解码技术来源于google 2023年提出的 Fast Inference from Transformers via Speculative Decoding。

2026 年 08 月 31 日 · 11 分钟 · 5159 字 · Ge Zhang

大模型推理并行部署:DP、TP、PP、EP、SP 与 CP 的区别

DP 复制模型拆请求,TP 拆一层里的矩阵,PP 拆模型层,EP 拆 MoE 专家,SP/CP 则围绕序列维度和长上下文拆分 activation 与 attention。

2026 年 08 月 20 日 · 6 分钟 · 2981 字 · Ge Zhang

AWQ 详解:激活感知权重量化如何保护重要通道

AWQ 不用 Hessian 补偿已量化权重,而是根据激活幅度识别重要输入通道,在量化前搜索逐通道缩放因子,让全部权重仍可规整地存为 INT4 或 INT3。

2026 年 08 月 11 日 · 8 分钟 · 3552 字 · Ge Zhang

Optimal Brain Surgeon(OBS):带补偿的二阶剪枝方法

OBS 相比 OBD 的关键区别在于补偿:删除某个权重以后,它允许其他权重沿着 Hessian 给出的二阶曲率方向共同调整,从而尽量降低剪枝带来的损失增量。

2026 年 08 月 10 日 · 6 分钟 · 2557 字 · Ge Zhang

1. 两数之和

两数之和可以用哈希表在一次遍历中完成:遍历当前数字时,查找 target - 当前值是否已经出现,若存在就返回两个下标。

2026 年 08 月 08 日 · 2 分钟 · 727 字 · Ge Zhang

Optimal Brain Damage(OBD):用 Hessian 判断权重重要性

权重绝对值小不等于权重不重要。OBD 使用 Hessian 对角元素衡量损失对各权重方向的曲率,以二阶显著性分数选择删除后损失增加最小的权重。

2026 年 07 月 29 日 · 11 分钟 · 5253 字 · Ge Zhang

大模型量化粒度详解:逐层、逐通道与逐组量化

量化粒度决定多少个权重共享一套量化参数。本文通过一个 4×8 权重矩阵,逐步推导逐层、逐通道与逐组量化的公式、误差、优缺点和适用场景。

2026 年 07 月 28 日 · 6 分钟 · 2572 字 · Ge Zhang