[论文解读] Knowledge Distillation as Efficient Pre-training: Faster Convergence, Higher Data-efficiency, and Better Transferability
本文提出知识蒸馏作为高效预训练(KDEP),一种通过SVD和幂温缩放(PTS)实现非参数化特征维数对齐,将预训练教师模型的特征表示迁移至学生模型的方法。KDEP在仅使用1/10数据和1/5训练时间的情况下,实现了与监督预训练相当的迁移性能,从而实现了更快、更高效、更具迁移能力的模型预训练。
Large-scale pre-training has been proven to be crucial for various computer vision tasks. However, with the increase of pre-training data amount, model architecture amount, and the private/inaccessible data, it is not very efficient or possible to pre-train all the model architectures on large-scale datasets. In this work, we investigate an alternative strategy for pre-training, namely Knowledge Distillation as Efficient Pre-training (KDEP), aiming to efficiently transfer the learned feature representation from existing pre-trained models to new student models for future downstream tasks. We observe that existing Knowledge Distillation (KD) methods are unsuitable towards pre-training since they normally distill the logits that are going to be discarded when transferred to downstream tasks. To resolve this problem, we propose a feature-based KD method with non-parametric feature dimension aligning. Notably, our method performs comparably with supervised pre-training counterparts in 3 downstream tasks and 9 downstream datasets requiring 10x less data and 5x less pre-training time. Code is available at https://github.com/CVMI-Lab/KDEP.
研究动机与目标
- 为解决在大规模或私有数据集上对所有模型架构进行预训练的低效与不可行性问题。
- 探究预训练教师模型中浓缩的知识是否可高效迁移至新学生模型以用于下游任务。
- 克服现有知识蒸馏方法通过任务特定头或可学习适配器间接监督特征学习的局限性。
- 开发一种非参数化、无参数的特征维数对齐方法,以保持教师模型的表示质量。
- 实现在新模型预训练中的更快收敛、更高数据效率和更强迁移能力。
提出的方法
- 提出一种基于特征的知识蒸馏方法,直接利用教师模型倒数第二层特征监督学生模型的特征提取器。
- 采用奇异值分解(SVD)对教师与学生模型之间的特征维数进行非参数化对齐,实现最小信息损失。
- 引入幂温缩放(PTS)以减少SVD处理后特征的通道方差差异,提升优化稳定性。
- 在对齐模块中避免可学习参数,确保蒸馏过程中不引入额外参数或梯度。
- 仅使用教师模型的特征表示(而非logits)作为监督信号,使其适用于表示学习的通用性。
- 在小规模、多样化的数据集上于预训练阶段应用蒸馏,实现学生模型的高效初始化。
实验结果
研究问题
- RQ1知识蒸馏能否被有效重构为一种预训练策略,以实现从教师模型到学生模型的表示迁移?
- RQ2为何现有知识蒸馏方法在预训练场景中表现不佳,特别是在蒸馏logits或使用参数化适配器时?
- RQ3通过SVD和PTS实现的非参数化特征对齐,是否能在预训练的特征蒸馏中优于参数化方法(如1×1卷积)?
- RQ4KDEP在多大程度上可减少数据需求和训练时间,同时保持迁移性能?
- RQ5未标注数据的选择(如基于物体的 vs. 基于场景的)在多大程度上影响KDEP的性能?
主要发现
- KDEP在仅使用10%数据和4.0小时训练时间的情况下,ImageNet-1K上达到74.79%的top-1准确率,与使用10倍数据和5倍时间的监督预训练性能相当。
- 在10% ImageNet-1K数据下,KDEP(SVD+PTS)达到75.74%准确率,优于相同数据和时间约束下的监督预训练(71.05%)。
- 在100% ImageNet-1K数据下,KDEP达到78.40%准确率,超过监督预训练(77.13%),并在某些设置下超越更大的教师模型。
- 使用更强教师模型(MS R50)时,KDEP在10%数据和180个周期下达到77.07%准确率,优于监督预训练和传统知识蒸馏方法。
- ImageNet-1K在KDEP中表现最佳,因其数据多样性高且以物体为中心;而仅含纹理的数据集(DTD)表现最差,因多样性低。
- 该方法引入的计算开销可忽略不计,训练时间与GPU显存使用量几乎与监督预训练相同。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。