跳到正文
Chengshu
@skadai · 2026.09.30
文章
原创
系列
标签
搜索
关于
RSS
Chengshu
/
标签
/
系统设计
系统设计
1 篇文章
2026年9月28日
走进 vLLM(一):LLM Engine 与 Engine Core
一个现代高吞吐 LLM 推理系统的最小内核长什么样:从一次离线 generate 调用出发,拆开 LLM Engine 的构造函数、generate 函数、Scheduler,以及一次 forward pass 里到底发生了什么——顺带把 paged attention、continuous batching、KV cache block 这些词讲成人话。
vLLM
LLM 推理
推理引擎
系统设计
术语科普
→