GPU
4 篇文章
- 《走进 TPU 与 GPU 集群:集合通信的解剖》中英对照全译Aleksa Gordić 的长文《Inside TPU and GPU Clusters: The Anatomy of Collective Communication》全文对照翻译:左栏英文原文、右栏对应中文。从 TPU 的 2D/3D torus 与 GPU 的 fat tree 拓扑讲起,把 All-Gather、Reduce-Scatter、All-Reduce、All-to-All 的 ring/tree 实现、代价模型,以及 SHARP 与跨节点分层通信一次讲透。
- 《让深度学习跑出 Brrrr》中英对照全译:从第一性原理看清 compute、带宽与 overheadHorace He 的经典长文《Making Deep Learning Go Brrrr From First Principles》全文对照翻译:左栏英文原文、右栏中文译文。用「工厂」类比讲清 compute / memory bandwidth / overhead 三种性能 regime,以及 operator fusion、compute intensity、CUDA Graph 这些优化的适用边界。
- Stanford CS336 第五讲精读:GPU 硬件、访存瓶颈,以及 Flash Attention 是怎么被逼出来的斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第五讲完整讲义:为什么这一讲只讲单卡硬件、CPU 优化延迟而 GPU 优化吞吐、SM/warp/block 的执行模型与物理内存层级、同样重要的 TPU 支线,以及那张「波浪形」矩阵乘法性能图的三重谜底(roofline、tiling 对齐、wave quantization)——低精度、算子融合、重计算、访存合并、tiling 这五件提速法宝最终如何拼成 Flash Attention。
- Stanford MS&E435:GPU 经济 | The GPU EconomyStanford MS&E435 课堂对谈笔记:Brad Gerstner 与 Sunny Madra 讨论 GPU/推理成本、token 工厂与 AI 商业模式。