这里记录投机解码、并行验证、KV Cache、量化、批处理、服务调度,以及计算和访存瓶颈等模型推理主题。
从 config.json 读懂 Llama 2 7B
config.json 不只是模型加载配置:从层数、隐藏维度、注意力头、上下文长度和精度字段,可以还原 Llama 2 7B 的网络结构并估算推理资源。
这里记录投机解码、并行验证、KV Cache、量化、批处理、服务调度,以及计算和访存瓶颈等模型推理主题。
config.json 不只是模型加载配置:从层数、隐藏维度、注意力头、上下文长度和精度字段,可以还原 Llama 2 7B 的网络结构并估算推理资源。
DFlash 的关键并不只是增加模型层数,而是把跨 token 的串行草稿改造成一次前向中的块级并行预测。