跳到正文
Chengshu
@skadai · 2026.09.30
文章
原创
系列
标签
搜索
关于
RSS
Chengshu
/
标签
/
PagedAttention
PagedAttention
1 篇文章
2026年9月10日
What is vLLM? Efficient AI Inference for Large Language Models
IBM Technology 视频笔记:vLLM 用 PagedAttention 分页管理 KV cache、用 continuous batching 填满 GPU,论文口径吞吐约为 Hugging Face Transformers / TGI 的 24 倍。
youtube转录
vLLM
LLM推理
PagedAttention
→