缩放定律
2 篇文章
- Stanford CS336 第九讲精读:缩放定律(上)——从 1993 年的学习曲线,到 Chinchilla 的三种拟合方法斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第九讲完整讲义,主讲 Tatsunori Hashimoto。这一讲先把缩放定律放回统计学习理论的历史里(VC 维的 1/√m、非参数速率的 n^(−β/(2β+1))、1993 年 Bell Labs 那篇几乎没有引用的学习曲线论文、Hestness 2017 的三阶段曲线),再用两个玩具例子说明'幂律为什么是自然的'(估计均值得斜率 1、非参数回归得斜率 −1/d 与内在维度),然后逐一拆解模型工程里最实用的几件事——架构/优化器选择、深度与宽度、batch size 与临界 batch size、学习率与 muP——最后落到'更多数据还是更大模型':联合缩放定律与 Chinchilla 的三种方法(最小包络、IsoFLOP、联合拟合),以及 Epoch AI 如何通过'从图里取证读点'复现方法三、发现原论文只是曲线拟合的残差没零均值。
- Stanford CS336 第十一讲精读:缩放定律(下)——真实世界的 scaling 配方,与 muP 的两条谱条件斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十一讲完整讲义,主讲 Percy Liang。这是 scaling laws 两讲中的第二讲,也是更偏案例与细节的一讲。上半场把'真实模型是怎么用 scaling law 的'拆成四个案例:Cerebras-GPT 与 MiniCPM 如何用 muP 把超参从规模里解耦、MiniCPM 如何用 WSD(warm-up / stable / decay)学习率把 Chinchilla 复现从 n² 次训练压到近似一次、DeepSeek LLM 如何不靠 muP 直接网格搜索最优 batch 与学习率、以及近一年 Llama 3(约 39:1)、Hunyuan-1(96:1)、MiniMax-01 这些公开 scaling 研究给出了什么。下半场用四十分钟深潜 muP:从两条'谱条件'(初始化时激活为 Θ(1)、走一步梯度后激活变化仍为 Θ(1))出发,在一个深线性网络上推导出 1/√fan-in 的初始化和逐层学习率 fan-out/fan-in(SGD)或 1/fan-in(Adam),再对照大规模消融实验看它什么时候有效、什么时候失效。