跳到正文
Chengshu
@skadai · 2026.09.30
文章
系列
标签
搜索
关于
RSS
Chengshu
/
标签
/
KV Cache
KV Cache
1 篇文章
2026年9月13日
LLM 为什么缓存 K 和 V,却通常不缓存 Q?
为什么 attention 通常缓存 K/V 而不缓存 Q:prefill/decode、causal attention,以及显存代价。转载自 Dongxi 东锡 NLP。
X转录
LLM
KV Cache
笔记
→