Chengshu@skadai · 2026.09.30

关于deepseek部署你要知道的一切

给只懂 vanilla transformer 的人写的 DeepSeek-V4.1-Flash 部署术语课

以 vLLM Recipes 官方页面 deepseek-ai/DeepSeek-V4.1-Flash(Updated 2026-09-20)为底稿,把 MoE、Engram、两级稀疏注意力、超连接、YaRN、MXFP4/MXFP8、TP/DEP、PD 分离这些术语逐个拆开讲清楚:它是什么、为什么需要它、不知道它会踩什么坑。13 篇正文已全部更新完毕,另附官方页面中文全译。

系列封面:以书库形态呈现的服务器、被点亮的少数专家模块,以及代表长上下文的光带

目录

已更新 14 篇
  1. 第 1 篇它到底有多大:552B、196B、8B/16B 三个数字分别是什么
  2. 第 2 篇384 个专家里只叫醒 6 个:MoE 与路由入门
  3. 第 3 篇模型也会看图:ViT、aligner、图像 token 与 Encoder parallel
  4. 第 4 篇注意力与 KV cache:为什么「长上下文」本质是显存问题
  5. 第 5 篇两级稀疏注意力:滑窗、压缩 KV latent 与 indexer
  6. 第 6 篇Engram:给模型配一本 384M 行的词组小抄
  7. 第 7 篇超连接与 Sinkhorn:残差流为什么要开四条副本
  8. 第 8 篇1M 上下文怎么来的:RoPE、YaRN 与 theta
  9. 第 9 篇BF16/FP8/MXFP4/MXFP8/UE8M0:数字格式与 511GB 显存账本
  10. 第 10 篇猜 5 个再验一遍:投机解码与 DSpark 草稿头
  11. 第 11 篇并行三兄弟:TP / DP / EP(DEP)
  12. 第 12 篇PD 分离、NIXL 与 vllm-router:prefill 和 decode 为什么分居
  13. 第 13 篇上手篇:把 V4.1-Flash 跑起来
  14. 附录附录:vLLM DeepSeek-V4.1-Flash 部署说明中文全译