Tokenizer 基础:从文本到 Token ID

Tokenizer 不只是切词:它要在词表大小、序列长度、开放词汇与多语言覆盖之间权衡。本文用例子和一份可运行的 BPE 实现讲清主流算法。

2026 年 07 月 15 日 · 10 分钟 · 4689 字 · Ge Zhang

Token Recycling:把被丢弃的候选 Token 变成下一轮草稿

Token Recycling 不额外训练 draft model,而是保存目标模型验证时产生的 top-k 候选,用轻量邻接矩阵构造草稿树,再通过 Tree Attention 一次验证多条路径。

2026 年 07 月 14 日 · 6 分钟 · 2636 字 · Ge Zhang