LLM推理
2 篇文章
- Stanford CS336 第十讲精读:推理——为什么 generation 是访存受限的,以及 KV cache 的五种瘦身法斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十讲完整讲义,主讲 Percy Liang。这一讲把'推理'当成一门系统工程课来讲:先给出一张算力账(算术强度、accelerator intensity、prefill 与 generation 的两阶段模型),说明为什么训练的瓶颈是算力而推理的瓶颈是显存带宽;再用 Llama-2 13B + H100 把延迟、吞吐与 batch size 的三角关系算成具体数字;然后用整场后半段讲 KV cache 的五种瘦身法(GQA、MLA、跨层注意力 CLA、局部注意力、以及它们的组合拳),并跳出 Transformer 看状态空间模型、线性注意力与扩散模型;最后收在两类工程手段上——有损的量化与剪枝、无损的投机解码,以及服务系统里的连续批处理、选择性批处理与 PagedAttention。
- What is vLLM? Efficient AI Inference for Large Language ModelsIBM Technology 视频笔记:vLLM 用 PagedAttention 分页管理 KV cache、用 continuous batching 填满 GPU,论文口径吞吐约为 Hugging Face Transformers / TGI 的 24 倍。