MoE
4 篇文章
- Engram:给模型配一本 384M 行的词组小抄这台模型里唯一不参与"思考"的大块参数:第 1、14 层各有一张 384M 行 × 256 维的哈希表,用 2/3/4-gram 哈希查表,通过学习的门写进残差流。196.6B 参数、183 GiB 显存,也是唯一适合 offload 到 CPU 内存的部分——但"输出不变"不等于"速度不变"。
- 384 个专家里只叫醒 6 个:MoE 与路由入门从"一家公司有 384 位专家、每来一个问题只准叫 6 个"讲起:MoE 为什么要切开 FFN,路由器这个"前台"到底在做什么,sqrtsoftplus 与 noaux_tc 偏置各自解决什么问题,为什么图像 token 要单独排一队,以及那句最该带走的话——MoE 省的是电费,不是房租。
- 它到底有多大:552B、196B、8B/16B 三个数字分别是什么拆开 DeepSeek-V4.1-Flash 的三个核心数字:552B 主干、196B Engram 记忆、每 prompt token 激活 8B / 每 output token 激活 16B。为什么容量按总量付费、速度按激活量算账,为什么 511 GB 权重只能用 Docker 跑,以及"1M 上下文"到底要不要 1M 显存。
- Stanford CS336 第四讲精读:混合专家(MoE),以及 DeepSeek V3 是怎么搭起来的斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第四讲完整讲义:MoE 到底是什么(其实和「专家分领域」毫无关系)、为什么在 FLOPs 对齐下它稳定地赢、token choice top-K 路由为什么成为唯一收敛的答案、细粒度专家与共享专家、负载均衡的 F·P 损失与 DeepSeek V3 的「无辅助损失」偏置、专家并行与 token dropping,以及把 DeepSeek V1/V2/V3 一路拆到 MLA 与多 token 预测。