跳到正文
Chengshu
@skadai · 2026.09.30
文章
原创
系列
标签
搜索
关于
RSS
Chengshu
/
标签
/
prefix caching
prefix caching
1 篇文章
2026年9月28日
走进 vLLM(二):chunked prefill、prefix caching 与 guided decoding
把基础 engine 流程扩出来的第一批高级特性:chunked prefill 怎么让长 prompt 不再独占一步;prefix caching 为什么本质上是「别重算你已经见过的前缀」;guided decoding 又是怎么用一台 FSM 把 logits 里不该出现的 token 直接按成负无穷。
vLLM
LLM 推理
推理引擎
prefix caching
术语科普
→