Chengshu@skadai · 2026.09.30

走进 vLLM:高吞吐 LLM 推理系统解剖

把一篇八千词的长文拆成 5 篇中英对照的导读:左栏原文,右栏译文

以 vLLM 官方博客《Inside vLLM: Anatomy of a High-Throughput LLM Inference System》(Aleksa Gordic,2025-09-05,基于 commit 42172ad)为底稿的全文翻译。从 LLM Engine 构造函数与 Scheduler 讲起,覆盖 paged attention、continuous batching、chunked prefill、prefix caching、guided decoding、speculative decoding、disaggregated P/D,再到 MultiProcExecutor、多机多副本的分布式服务,最后落到 latency 与 throughput 的度量。原文 18 张配图全部保留。每篇都是左右对照:左栏是英文原文,右栏是对应的中文翻译,不好翻译的术语保留英文写法。

目录

已更新 5 篇
  1. 第 1 篇走进 vLLM(一):LLM Engine 与 Engine Core
  2. 第 2 篇走进 vLLM(二):chunked prefill、prefix caching 与 guided decoding
  3. 第 3 篇走进 vLLM(三):speculative decoding 与 disaggregated P/D
  4. 第 4 篇走进 vLLM(四):从单卡到多机——MultiProcExecutor 与分布式服务
  5. 第 5 篇走进 vLLM(五):benchmark 与 auto-tuning —— latency 与 throughput 之争