深度学习模型量化的 INT8/FP16
模型量化用更低精度(INT8/FP16)减少模型体积和推理延迟。校准数据选择影响精度损失。量化感知训练效果优于训练后量化。本文对比 INT8 和 FP16 的精度损失。
21
0
0
2026-07-10
QLoRA 微调完整流程
从零开始实践 QLoRA 微调,涵盖 4-bit 量化加载、LoRA 配置、训练监控,以及训练后权重合并与导出。
20
0
0
2026-06-22
bitsandbytes 8-bit/4-bit
实践 bitsandbytes 库,通过 LLM.int8()、NF4、双重量化等量化方案在消费级 GPU 上加载并微调超大规模模型,结合 QLoRA 尤佳。
19
0
0
2026-06-14
AWQ 激活感知量化
学习 Activation-aware Weight Quantization,通过对重要权重通道基于激活分布进行缩放保护,仅优化少量缩放因子实现 SOTA 低比特量化。
18
0
0
2026-06-14
QLoRA 高效微调
解析 QLoRA 如何结合 4-bit NormalFloat 量化与 LoRA,通过双量化和分页优化器在极小显存下实现千亿大模型的单卡微调。
17
0
0
2026-06-13