跳到正文
Chengshu
@skadai · 2026.09.30
文章
原创
系列
标签
搜索
关于
RSS
Chengshu
/
标签
/
推理加速
推理加速
1 篇文章
2026年9月25日
猜 5 个再验一遍:投机解码与 DSpark 草稿头
decode 是带宽瓶颈,搬一次权重只写一个字太浪费。投机解码让草稿器先猜 5 个 token,再由主模型一次验证——DSpark 是三阶段(每阶段 128 专家取 3)、读取第 37–39 层注意力输入的小模型。还包括 AMD 上必须关掉自适应验证的两个具体检查,以及 --max-cudagraph-capture-size 里 128×(1+5) 的由来。
DeepSeek
vLLM
模型部署
推理加速
术语科普
→