免费编程教程

MobileLLM

学习 MobileLLM 针对手机延迟和内存受限的设计原则,包括深度增加、嵌入共享和分组查询注意力。

15 0 0
2026-06-28
大模型小型化研究

综述当前将大规模语言模型缩小但仍保持强大能力的研究方向,包括 Phi、Gemma 等轻量级架构。

12 0 0
2026-06-28
近似遗忘

利用影响函数或参数空间更新近似删除训练样本的影响,无需完整重训练,兼顾效率与隐私。

16 0 0
2026-06-27
IA3 轻量微调

学习 IA3 方法,仅在模型中引入三个可学习的缩放向量,通过按元素相乘调整激活,实现极致参数效率。

20 0 0
2026-06-22
提示微调 p-tuning

学习 P-Tuning 通过在输入嵌入层插入可学习的连续提示向量,以极低参数量实现自然语言理解任务的高效微调。

24 0 0
2026-06-22
稀疏注意力 Sparse Attn

学习通过稀疏化注意力矩阵,如局部窗口、空洞窗口和全局标记等方式,显著降低计算量并扩展模型上下文长度。

20 0 0
2026-06-21
线性注意力机制

综述线性注意力机制的基本思想,通过核函数分解或关联内存设计,将标准注意力的 O(n²) 降至 O(n),应对长序列建模。

27 0 0
2026-06-21
高效网络 EfficientNet

学习 EfficientNet 提出的复合缩放方法,同时调整网络宽度、深度和分辨率,在约束资源下获得卓越精度。

21 0 0
2026-06-21
动作识别 TSN/TSM

学习时间片段网络 TSN 的稀疏采样策略,以及时间移位模块 TSM 如何用零参数实现高效时序交互,大幅提升动作识别速度。

37 0 0
2026-06-19
LightGBM 高效提升

利用 LightGBM 的直方图算法和 Leaf-wise 生长,高效处理大规模数据集。

30 0 0
2026-06-16