
系列:《LLM 技术全景:从 Token 到部署》定位:工程实践篇 · 第 3 篇(总第 35 篇)上承:第 34 篇《知识蒸馏与模型剪枝》(把模型压小压省)下启:第 36 篇《TensorRT-LLM 实战》(NVIDIA 硬核加速)摘要核心问题:模型训练好了,怎么"高吞吐、低成本"地服务出去?朴素做法(一次一个请求、整块显存预分配)会把 GPU 利用率压到 20% 以下。vLLM 的答案:用PagedAttention把 KV Cache 像操作系统管理内存一样分页,消除显存碎片;用连续批处理(Continuous Batching)把随时到达、长短不一的请求塞进同一批,把 GPU 拉满。阅读收获:看懂为什么"传统 serving 吞吐低"——根因是 KV Cache 显存浪费 + 静态批处理;理解 PagedAttention 如何用"块表"把显存利用率从 ~20% 拉到 ~95%;能够照着实战代码把 vLLM 跑起来,并选对关键参数;