免费编程教程

vLLM 高性能 LLM 推理

vLLM 用 PagedAttention 管理 KV 缓存大幅提升 LLM 推理吞吐。连续批处理提高 GPU 利用率。支持量化 AWQ/GPTQ。本文部署 vLLM 兼容 OpenAI API。

14 0 0
2026-07-11
多模型路由

实现根据任务类型、语言或用户等级将请求智能路由到对应的专用模型,平衡成本与效果。

19 0 0
2026-06-29
流式输出 SSE

实现基于 Server-Sent Events 的流式推理输出,让大模型逐 Token 返回给前端,提升交互体验。

18 0 0
2026-06-29
带宽优化

通过压缩提示和输出、采用二进制协议或连接复用,减少模型服务的网络带宽消耗。

17 0 0
2026-06-29
负载均衡 LLM

使用网关或反向代理将大模型推理请求均衡地分发到多个推理实例,配合健康检查和会话保持。

17 0 0
2026-06-29
优先级队列

在推理服务中实现基于优先级的排队,高优请求可插队或抢占资源,确保核心业务体验。

21 0 0
2026-06-29
请求调度策略

设计模型服务端的请求调度算法,平衡不同用户和任务对延迟及吞吐的需求,保证服务质量。

19 0 0
2026-06-29
多模型服务

学习在有限 GPU 资源上同时部署多个不同模型,通过显存管理和算力切分实现多租户推理。

22 0 0
2026-06-29
Triton 模型编排

在 Triton 推理服务器上编排多模型处理流程,包括图像预处理、模型串联和后处理,实现一站式推理。

18 0 0
2026-06-29
大模型服务引擎

比较主流的大模型推理服务引擎在吞吐、延迟、灵活性和生态上的差异,为技术选型提供依据。

16 0 0
2026-06-29
GPU 机密计算

了解最新 GPU 的硬件级机密计算能力,在 GPU 显存中对数据和模型进行加密隔离,保护推理安全。

29 0 0
2026-06-29
可信执行推理

将模型推理放在硬件隔离的可信执行环境中,保证模型和数据对云服务商等特权方的不可见性。

15 0 0
2026-06-29
动态量化

在推理时动态计算激活的量化参数,权重提前量化,适合批处理较少的在线推理场景。

21 0 0
2026-06-29
手机 GPU 推理

使用 GPU 委托(如 TFLite GPU Delegate)在安卓和 iOS 设备上运行优化后的神经网络,降低时延。

16 0 0
2026-06-28
奥数 AI

探索 AI 在奥赛级别数学难题上的能力,结合几何定理证明器和组合优化求解复杂问题。

15 0 0
2026-06-26
知识图谱补全

使用基于嵌入或基于规则的方法对不完整知识图谱进行补全,预测头实体、关系或尾实体。

16 0 0
2026-06-26
视觉问答 VQA

构建能根据图像内容回答自然语言问题的模型,学习特征融合、共同注意力和多模态推理等核心 VQA 技术。

18 0 0
2026-06-19
TensorRT 推理优化

使用 NVIDIA TensorRT 对模型进行低精度量化和图优化,获得极致推理速度。

23 0 0
2026-06-17
知识图谱构建与推理

端到端了解知识图谱构建流水线,包括命名实体识别、关系抽取、实体链接以及基于嵌入或规则的图谱补全与推理。

28 0 0
2026-06-14
贝叶斯网络

构建有向无环图表示的贝叶斯网络,学习参数和结构学习,以及基于变量消除的精确与近似概率查询与因果推理。

18 0 0
2026-06-14
OpenVINO LLM 推理

掌握使用 OpenVINO 工具套件在英特尔 CPU、GPU 和 NPU 上优化并部署大语言模型,实现低比特量化与高效推理的最佳实践。

25 0 0
2026-06-14
思维链 Chain-of-Thought

深入理解思维链提示,通过“让我们一步步思考”或更复杂的零样本/少样本 CoT 策略,显著提升大模型在数学、逻辑等复杂推理上的表现。

20 0 0
2026-06-14