KV Cache 量化
将存储的键和值张量量化为 INT8 甚至更低精度,大幅降低长序列推理时的 KV 缓存显存占用量。
19
0
0
2026-06-29
稀疏注意力 Sparse Attn
学习通过稀疏化注意力矩阵,如局部窗口、空洞窗口和全局标记等方式,显著降低计算量并扩展模型上下文长度。
20
0
0
2026-06-21