为什么 DFlash 比 EAGLE-3 推理更快?

DFlash 的关键并不只是增加模型层数,而是把跨 token 的串行草稿改造成一次前向中的块级并行预测。

2026 年 07 月 15 日 · 6 分钟 · 2869 字 · Ge Zhang

Token Recycling:把被丢弃的候选 Token 变成下一轮草稿

Token Recycling 不额外训练 draft model,而是保存目标模型验证时产生的 top-k 候选,用轻量邻接矩阵构造草稿树,再通过 Tree Attention 一次验证多条路径。

2026 年 07 月 14 日 · 6 分钟 · 2636 字 · Ge Zhang