注意力机制
2 篇文章
- 《走进 Transformer:一个 token 的一生》中英对照全译Aleksa Gordić 的长文《Inside the Transformer: The Life of a Token》全文对照翻译:左栏英文原文、右栏对应中文。用 Rnj 1.5 的真实结构走一遍前向传播,逐个拆开 RMSNorm、GeGLU MLP、多头注意力、YaRN 与 core attention,并把 KV cache、参数量、FLOPs 和集群规模一次算清。
- 两级稀疏注意力:滑窗、压缩 KV latent 与 indexer1M 上下文凭什么可行:每层 128 token 滑窗看近处,压缩 KV latent 看远处,indexer 用 2048 块粗筛 + 512 精筛决定"该看哪里"。还有两个关键细节——只有第 2、8、14、20 层真正写摘要、其余 36 层共享,以及压缩 KV 为什么要用自己的一套 RoPE theta。