从 config.json 读懂 Llama 2 7B

config.json 不只是模型加载配置:从层数、隐藏维度、注意力头、上下文长度和精度字段,可以还原 Llama 2 7B 的网络结构并估算推理资源。

2026 年 07 月 24 日 · 9 分钟 · 4152 字 · Ge Zhang

为什么 DFlash 比 EAGLE-3 推理更快?

DFlash 的关键并不只是增加模型层数,而是把跨 token 的串行草稿改造成一次前向中的块级并行预测。

2026 年 07 月 15 日 · 6 分钟 · 2869 字 · Ge Zhang