vLLM 高性能 LLM 推理
vLLM 用 PagedAttention 管理 KV 缓存大幅提升 LLM 推理吞吐。连续批处理提高 GPU 利用率。支持量化 AWQ/GPTQ。本文部署 vLLM 兼容 OpenAI API。
14
0
0
2026-07-11
PagedAttention 分页注意力
学习 PagedAttention 如何借鉴操作系统分页思想,将 KV 缓存划分为块进行非连续存储,近乎消除内部碎片,革命性提升服务吞吐。
11
0
0
2026-06-14