Chengshu@skadai · 2026.09.30

Karpathy

4 篇文章

  • Karpathy《Let's build GPT》第一篇:语言模型、字符级 tokenizer 与 bigram 基线Karpathy《Let's build GPT》精读系列第一篇。这一篇把地基打好:语言模型为什么是「逐 token 预测下一个」;1MB 的 tiny Shakespeare 怎么变成 65 个字符的字符级 tokenizer;一段 9 个字符里为什么藏着 8 个训练样本;4×8 的 batch 里 32 个样本为什么互不通信;然后用一个 vocab×vocab 的查表(bigram 语言模型)跑通「取 batch → 算损失 → 反传 → 更新」的完整闭环,并亲手算出初始损失 4.87 比均匀分布的理论下界 4.17 还差意味着什么。文中 13 张配图均截自视频对应时刻,并把当时的完整观点句(英文原句+中文翻译)拼进图里。KarpathyGPTTransformernanoGPT从零实现系列教程
  • Karpathy《Let's build GPT》第二篇:自注意力——从「加权平均的数学技巧」到 Q / K / VKarpathy《Let's build GPT》精读系列第二篇,也是整门课最核心的一段。先用一个玩具例子(B,T,C = 4,8,2)把「用下三角矩阵乘法做加权聚合」这个数学技巧练熟:全 1 矩阵左乘等于按行求和、tril 是「未来不许说话」的闸门、masked_fill(-inf)+softmax 让权重从常数变成亲和度。然后把这个技巧搬进真模型,推出单头自注意力:每个 token 发出 query(我在找什么)和 key(我包含什么),q@k^T 得到亲和度、除以 √head_size 控制方差、掩码、softmax、最后 out = wei @ v。并逐条讲清四个要点:注意力是通信机制、它没有空间概念(所以要位置编码)、batch 之间永不通信、encoder block 与 decoder block 只差删掉掩码那一行。文中 14 张配图均截自视频对应时刻,并把当时的完整观点句(英文原句+中文翻译)拼进图里。KarpathyGPTTransformernanoGPT从零实现系列教程
  • Karpathy《Let's build GPT》第三篇:多头注意力、前馈、残差与 LayerNorm——拼出完整的 Transformer BlockKarpathy《Let's build GPT》精读系列第三篇:把 Transformer Block 剩下的零件全部装上,并首次跑出真正的 GPT 结构。多头注意力(多条并行通信频道,输出拼接后投影回 n_embd)→ 前馈网络(逐 token 独立的 Linear-ReLU-Linear,中间放大 4 倍,负责「计算」)→ 残差连接(加法把梯度等量分给两路,形成通往输入的梯度高速公路)→ LayerNorm(归一化「行」而非「列」,只改一个维度数字;本课用 pre-norm)→ dropout,最后把模型放大到 n_embd=384、6 头、6 层、dropout 0.2。验证损失沿 2.4 → 2.28 → 2.24 → 2.08 → 2.06 → 1.48 一路下降,每一个数字对应一个具体零件。文中 13 张配图均截自视频对应时刻,并把当时的完整观点句(英文原句+中文翻译)拼进图里。KarpathyGPTTransformernanoGPT从零实现系列教程
  • Karpathy《Let's build GPT》第四篇:nanoGPT 走读、encoder vs decoder,以及从 1000 万参数到 GPT-3 的距离Karpathy《Let's build GPT》精读系列第四篇(收官):把论文架构图讲完(encoder、cross-attention 与 decoder-only 的关系),走读 nanoGPT(多头合并成四维批处理、MLP 用 GELU、checkpoint 与 DDP 等工程件),对照从 1000 万参数 / 30 万 token 到 GPT-3 的 175B / 300B token——结构几乎相同,规模差约一百万倍。最后讲清 ChatGPT 的两阶段:预训练只给你一个「文档补全器」,助手化还需要 SFT → 奖励模型 → PPO 三步对齐。文末另附「从 BERT 到 GPT:同一个 Transformer,三种用法」对照表(本文补充,专门写给做过 BERT 微调、没有大模型实战经验的人)。文中 10 张配图均截自视频对应时刻,并把当时的完整观点句(英文原句+中文翻译)拼进图里。KarpathyGPTTransformernanoGPT从零实现系列教程