从零理解 Speculative Decoding:原理、拒绝采样与技术演进
最经典的投机解码技术来源于google 2023年提出的 Fast Inference from Transformers via Speculative Decoding。
最经典的投机解码技术来源于google 2023年提出的 Fast Inference from Transformers via Speculative Decoding。
DFlash 的关键并不只是增加模型层数,而是把跨 token 的串行草稿改造成一次前向中的块级并行预测。
Token Recycling 不额外训练 draft model,而是保存目标模型验证时产生的 top-k 候选,用轻量邻接矩阵构造草稿树,再通过 Tree Attention 一次验证多条路径。