Chengshu@skadai · 2026.09.30

Stanford CS336 精读

Language Modeling from Scratch · 2025 Spring 逐讲笔记

斯坦福 CS336《Language Modeling from Scratch》全部 17 讲的完整中文讲义:为什么先讲分词、PyTorch 的资源账、架构与超参数、MoE、GPU、Triton 内核、并行、scaling laws、推理、评测、数据与对齐。每讲按课堂顺序逐段整理,并附讲座配图。

目录

已更新 17 篇
  1. 第一讲Stanford CS336 第一讲精读:从零构建语言模型,为什么先讲分词?
  2. 第二讲Stanford CS336 第二讲精读:PyTorch 与资源核算——训一个大模型到底要多少显存和算力?
  3. 第三讲Stanford CS336 第三讲精读:Transformer 架构与超参数,哪些改动是真的重要?
  4. 第四讲Stanford CS336 第四讲精读:混合专家(MoE),以及 DeepSeek V3 是怎么搭起来的
  5. 第五讲Stanford CS336 第五讲精读:GPU 硬件、访存瓶颈,以及 Flash Attention 是怎么被逼出来的
  6. 第六讲Stanford CS336 第六讲精读:Kernels 与 Triton——从 PyTorch 一路降到 PTX
  7. 第七讲Stanford CS336 第七讲精读:并行(上)——ZeRO/FSDP、流水线并行与张量并行
  8. 第八讲Stanford CS336 第八讲精读:并行(下)——把集合通信、数据/张量/流水线并行写成代码
  9. 第九讲Stanford CS336 第九讲精读:缩放定律(上)——从 1993 年的学习曲线,到 Chinchilla 的三种拟合方法
  10. 第十讲Stanford CS336 第十讲精读:推理——为什么 generation 是访存受限的,以及 KV cache 的五种瘦身法
  11. 第十一讲Stanford CS336 第十一讲精读:缩放定律(下)——真实世界的 scaling 配方,与 muP 的两条谱条件
  12. 第十二讲Stanford CS336 第十二讲精读:评估——从 perplexity 到 Agent 与安全基准,一场『评估危机』里的方法论
  13. 第十三讲Stanford CS336 第十三讲精读:Data 1——数据不会从天上掉下来,从 BERT 的 BooksCorpus 到 Nemotron-CC 的完整数据工程史
  14. 第十四讲Stanford CS336 第十四讲精读:Data 2——过滤与去重的算法机制,从 KenLM、fastText、重要性重采样到布隆过滤器与 MinHash LSH
  15. 第十五讲Stanford CS336 第十五讲精读:Alignment——人类怎么把自己的偏好装进模型,从 SFT 到 RLHF
  16. 第十六讲Stanford CS336 第十六讲精读:Alignment——从 PPO 到 GRPO,再到 R1 / Kimi / Qwen3 的可验证奖励 RL
  17. 第十七讲Stanford CS336 第十七讲精读:Alignment——把策略梯度和 GRPO 的机制拆到底