Skip to main content
QUICK REVIEW

[论文解读] SimReg: Regression as a Simple Yet Effective Tool for Self-supervised Knowledge Distillation

K L Navaneet, Soroush Abbasi Koohpayegani|arXiv (Cornell University)|Jan 13, 2022
Neural Networks and Applications被引用 5
一句话总结

本文提出 SimReg,一种用于自监督学习的简单而有效的知识蒸馏方法,仅在训练阶段使用多层感知机(MLP)头,将学生特征回归至教师特征。令人惊讶的是,尽管后者更接近教师特征,但主干网络特征的表现优于 MLP 头特征。此外,使用相同的弱增强图像作为教师和学生的输入可进一步提升性能,在仅做最小架构修改的情况下,实现了 ImageNet 上的最先进结果。

ABSTRACT

Feature regression is a simple way to distill large neural network models to smaller ones. We show that with simple changes to the network architecture, regression can outperform more complex state-of-the-art approaches for knowledge distillation from self-supervised models. Surprisingly, the addition of a multi-layer perceptron head to the CNN backbone is beneficial even if used only during distillation and discarded in the downstream task. Deeper non-linear projections can thus be used to accurately mimic the teacher without changing inference architecture and time. Moreover, we utilize independent projection heads to simultaneously distill multiple teacher networks. We also find that using the same weakly augmented image as input for both teacher and student networks aids distillation. Experiments on ImageNet dataset demonstrate the efficacy of the proposed changes in various self-supervised distillation settings.

研究动机与目标

  • 提出一种简单有效的知识蒸馏方法,用于自监督模型,且不改变推理时的计算开销或内存占用。
  • 探究为何中间层学生特征的表现优于最后一层特征,尽管后者与教师特征匹配度更高。
  • 探索在蒸馏过程中,对教师和学生使用同一张弱增强图像是否能带来性能提升。
  • 评估使用单个学生模型同时蒸馏多个教师模型的效果,每个教师使用独立的 MLP 头。
  • 基准评估深层 MLP 头在来自自监督和监督教师模型的蒸馏中的有效性。

提出的方法

  • 仅在蒸馏阶段向学生网络的主干网络添加一个多层感知机(MLP)头,推理时将其丢弃。
  • 通过均方误差损失,使 MLP 头将学生的特征表示回归至教师的潜在特征。
  • 在蒸馏过程中,对教师和学生网络使用相同的弱增强图像作为输入,以提升对齐效果。
  • 使用多个教师网络(如 MoCo-v2、BYOL、SwAV)同时进行蒸馏,每个教师使用独立的 MLP 头。
  • 下游评估时使用学生主干网络的特征,而非最后一层的 MLP 层输出,尽管后者更接近教师特征。
  • 该方法适用于自监督和监督教师模型,证明了其在不同训练范式下的泛化能力。

实验结果

研究问题

  • RQ1为何学生主干网络的特征在下游任务中表现优于最后一层 MLP 层的输出,尽管后者与教师表示更接近?
  • RQ2对教师和学生使用相同的弱增强图像是否能提升蒸馏性能?
  • RQ3使用更深的 MLP 头是否能提升蒸馏性能,且不增加推理成本?
  • RQ4当使用单个学生模型并为每个教师配置独立 MLP 头时,多教师蒸馏的效果如何?
  • RQ5所提出的方法是否优于依赖记忆库和温度缩放的复杂最先进蒸馏技术?

主要发现

  • 在蒸馏过程中使用四层 MLP 头可显著提升下游性能,在从多个自监督教师模型蒸馏时,ImageNet 上的线性评估准确率达到 66.9%。
  • 学生主干网络的特征优于最后一层 MLP 层输出,线性准确率达到 66.9%,而 MLP 输出为 66.3%,尽管后者更接近教师特征。
  • 对教师和学生使用相同的弱增强图像可获得最佳性能(线性准确率 66.9%),优于使用不同或更强增强的情况。
  • 使用每个教师独立的四层 MLP 头进行多教师蒸馏,线性准确率达到 67.0%,显著优于线性头(相同设置下为 64.8%)。
  • 从监督的 ResNet-50 教师模型蒸馏时,MLP 头同样带来收益,四层头达到 73.5% 的线性准确率,而线性头仅为 67.5%。
  • 该方法在自监督蒸馏设置下实现了 ImageNet 上的最先进性能,且未增加推理成本或模型容量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。