KV cache
2 篇文章
- 《走进 Transformer:一个 token 的一生》中英对照全译Aleksa Gordić 的长文《Inside the Transformer: The Life of a Token》全文对照翻译:左栏英文原文、右栏对应中文。用 Rnj 1.5 的真实结构走一遍前向传播,逐个拆开 RMSNorm、GeGLU MLP、多头注意力、YaRN 与 core attention,并把 KV cache、参数量、FLOPs 和集群规模一次算清。
- 注意力与 KV cache:为什么「长上下文」本质是显存问题prefill 吃算力、decode 吃带宽:从 TTFT 讲到 KV cache 为什么随长度和并发线性增长。以及这个模型的反直觉之处——890 字节/token 让上下文几乎不再是显存问题,真正吃显存的是权重和批大小;顺带说清 --max-model-len、--max-num-seqs、--max-num-batched-tokens 该怎么排优先级,KV offloading 为什么是"用延迟换容量"。