关于deepseek部署你要知道的一切
给只懂 vanilla transformer 的人写的 DeepSeek-V4.1-Flash 部署术语课
以 vLLM Recipes 官方页面 deepseek-ai/DeepSeek-V4.1-Flash(Updated 2026-09-20)为底稿,把 MoE、Engram、两级稀疏注意力、超连接、YaRN、MXFP4/MXFP8、TP/DEP、PD 分离这些术语逐个拆开讲清楚:它是什么、为什么需要它、不知道它会踩什么坑。13 篇正文已全部更新完毕,另附官方页面中文全译。

目录
已更新 14 篇- 第 1 篇它到底有多大:552B、196B、8B/16B 三个数字分别是什么
- 第 2 篇384 个专家里只叫醒 6 个:MoE 与路由入门
- 第 3 篇模型也会看图:ViT、aligner、图像 token 与 Encoder parallel
- 第 4 篇注意力与 KV cache:为什么「长上下文」本质是显存问题
- 第 5 篇两级稀疏注意力:滑窗、压缩 KV latent 与 indexer
- 第 6 篇Engram:给模型配一本 384M 行的词组小抄
- 第 7 篇超连接与 Sinkhorn:残差流为什么要开四条副本
- 第 8 篇1M 上下文怎么来的:RoPE、YaRN 与 theta
- 第 9 篇BF16/FP8/MXFP4/MXFP8/UE8M0:数字格式与 511GB 显存账本
- 第 10 篇猜 5 个再验一遍:投机解码与 DSpark 草稿头
- 第 11 篇并行三兄弟:TP / DP / EP(DEP)
- 第 12 篇PD 分离、NIXL 与 vllm-router:prefill 和 decode 为什么分居
- 第 13 篇上手篇:把 V4.1-Flash 跑起来
- 附录附录:vLLM DeepSeek-V4.1-Flash 部署说明中文全译