走进 vLLM:高吞吐 LLM 推理系统解剖
把一篇八千词的长文拆成 5 篇中英对照的导读:左栏原文,右栏译文
以 vLLM 官方博客《Inside vLLM: Anatomy of a High-Throughput LLM Inference System》(Aleksa Gordic,2025-09-05,基于 commit 42172ad)为底稿的全文翻译。从 LLM Engine 构造函数与 Scheduler 讲起,覆盖 paged attention、continuous batching、chunked prefill、prefix caching、guided decoding、speculative decoding、disaggregated P/D,再到 MultiProcExecutor、多机多副本的分布式服务,最后落到 latency 与 throughput 的度量。原文 18 张配图全部保留。每篇都是左右对照:左栏是英文原文,右栏是对应的中文翻译,不好翻译的术语保留英文写法。
进入系列 →
