跳到正文
Chengshu
@skadai · 2026.09.30
文章
原创
系列
标签
搜索
关于
RSS
Chengshu
/
标签
/
长上下文
长上下文
1 篇文章
2026年9月25日
1M 上下文怎么来的:RoPE、YaRN 与 theta
这台模型只在 65,536 token 的训练窗口里见过世界,却提供 1,048,576 的上下文:65,536 × 16 = 1,048,576,那个 16 就是 YaRN 的 factor。从 RoPE 的旋转直觉讲到"模型内部有两套位置刻度"——压缩 KV 为什么要用自己的 theta 160,000,以及你能调的其实只有 --max-model-len。
DeepSeek
vLLM
模型部署
长上下文
术语科普
→