将多模态教师模型(如视觉-语言模型)的知识蒸馏到仅使用单模态输入的学生模型,简化部署。
除软标签外,让学生模型拟合教师模型中间层的特征图或嵌入,传递更高维的结构化知识。
深入自蒸馏实践,包括深层特征指导浅层、历史平均参数模型指导当前训练的自蒸馏范式。
在训练学生模型的同时更新教师模型,实现动态互学习,省去预训练固定教师模型的步骤。
让学生模型同时向多个教师模型学习,通过集成软标签或分层学习获得优于单一教师的性能。
规划知识蒸馏的训练时机和方式,比较离线预训练蒸馏、在线同步蒸馏和渐进式蒸馏的优劣。
将模型上一阶段的预测作为软目标指导当前训练,或利用 EMA 教师进行自蒸馏,起到平滑和正则化效果。
深入师生网络蒸馏,解决教师与学生结构不一致时的知识传递难题,包括中间层特征对齐、注意力迁移和关系蒸馏等高级技巧。
系统介绍知识蒸馏的基本框架,利用大型教师模型输出的软标签指导学生网络训练,实现模型压缩与性能迁移,降低部署成本。