Triton
1 篇文章
- Stanford CS336 第六讲精读:Kernels 与 Triton——从 PyTorch 一路降到 PTX斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第六讲完整讲义:为什么 benchmark 之前必须 warm-up 加 cuda.synchronize、torch.profiler 与 Nsight Systems 里 CPU 为什么总跑在 GPU 前面、一行 print 如何毁掉整条流水线、cutlass kernel 名字里的 tile 尺寸,以及「仓库—工厂」的算子融合比喻如何变成三个真实的 GELU 实现——手写 CUDA、Triton、torch.compile——最后用 Triton 写一个融合 softmax 收尾。