vLLM 高性能 LLM 推理
vLLM 用 PagedAttention 管理 KV 缓存大幅提升 LLM 推理吞吐。连续批处理提高 GPU 利用率。支持量化 AWQ/GPTQ。本文部署 vLLM 兼容 OpenAI API。
14
0
0
2026-07-11
Triton 模型编排
在 Triton 推理服务器上编排多模型处理流程,包括图像预处理、模型串联和后处理,实现一站式推理。
18
0
0
2026-06-29
OpenVINO LLM 推理
掌握使用 OpenVINO 工具套件在英特尔 CPU、GPU 和 NPU 上优化并部署大语言模型,实现低比特量化与高效推理的最佳实践。
25
0
0
2026-06-14
思维链 Chain-of-Thought
深入理解思维链提示,通过“让我们一步步思考”或更复杂的零样本/少样本 CoT 策略,显著提升大模型在数学、逻辑等复杂推理上的表现。
20
0
0
2026-06-14