这里记录投机解码、并行验证、KV Cache、量化、批处理、服务调度,以及计算和访存瓶颈等模型推理主题。
从 Padding 到 Continuous Batching:LLM 推理中的长度感知调度
长度感知调度不只是在组批前按长度分桶,还要同时控制请求组合、每轮 Token 预算、变长数据布局以及请求的动态进出。
这里记录投机解码、并行验证、KV Cache、量化、批处理、服务调度,以及计算和访存瓶颈等模型推理主题。
长度感知调度不只是在组批前按长度分桶,还要同时控制请求组合、每轮 Token 预算、变长数据布局以及请求的动态进出。
最经典的投机解码技术来源于google 2023年提出的 Fast Inference from Transformers via Speculative Decoding。
DP 复制模型拆请求,TP 拆一层里的矩阵,PP 拆模型层,EP 拆 MoE 专家,SP/CP 则围绕序列维度和长上下文拆分 activation 与 attention。
AWQ 不用 Hessian 补偿已量化权重,而是根据激活幅度识别重要输入通道,在量化前搜索逐通道缩放因子,让全部权重仍可规整地存为 INT4 或 INT3。
OBS 相比 OBD 的关键区别在于补偿:删除某个权重以后,它允许其他权重沿着 Hessian 给出的二阶曲率方向共同调整,从而尽量降低剪枝带来的损失增量。
权重绝对值小不等于权重不重要。OBD 使用 Hessian 对角元素衡量损失对各权重方向的曲率,以二阶显著性分数选择删除后损失增加最小的权重。
量化粒度决定多少个权重共享一套量化参数。本文通过一个 4×8 权重矩阵,逐步推导逐层、逐通道与逐组量化的公式、误差、优缺点和适用场景。
量化不是简单地把浮点数改成整数,而是在有限离散值中近似权重和激活。本文系统梳理 scale、zero point、对称量化、INT8 矩阵乘法与量化评估。