PyTorch
2 篇文章
- 《让深度学习跑出 Brrrr》中英对照全译:从第一性原理看清 compute、带宽与 overheadHorace He 的经典长文《Making Deep Learning Go Brrrr From First Principles》全文对照翻译:左栏英文原文、右栏中文译文。用「工厂」类比讲清 compute / memory bandwidth / overhead 三种性能 regime,以及 operator fusion、compute intensity、CUDA Graph 这些优化的适用边界。
- Stanford CS336 第二讲精读:PyTorch 与资源核算——训一个大模型到底要多少显存和算力?斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第二讲完整讲义:用两道「餐巾纸算术」题讲清训练的资源账——6 × 参数量 × token 数的算力从哪来、显存为什么是 16 字节/参数、float32 / float16 / bfloat16 / fp8 怎么选、PyTorch 张量的 storage 与 stride 为什么重要、MFU 怎么算,以及从参数初始化、优化器一路到激活值、梯度、优化器状态的完整内存账本,最后落到混合精度训练。