Skip to main content
QUICK REVIEW

[论文解读] Simple Distillation Baselines for Improving Small Self-supervised Models

Jindong Gu, Wei Liu|arXiv (Cornell University)|Jun 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 14被引用 4
一句话总结

本文提出 SimDis,一种简单的知识蒸馏框架,通过离线或在线蒸馏提升小型自监督模型的性能。通过将大型预训练教师模型的表征蒸馏到小型学生模型中,SimDis 在 ResNet-18 上实现了线性评估的最先进(SOTA)准确率,优于先前方法如 SEED,且无需使用记忆库或复杂组件。

ABSTRACT

While large self-supervised models have rivalled the performance of their supervised counterparts, small models still struggle. In this report, we explore simple baselines for improving small self-supervised models via distillation, called SimDis. Specifically, we present an offline-distillation baseline, which establishes a new state-of-the-art, and an online-distillation baseline, which achieves similar performance with minimal computational overhead. We hope these baselines will provide useful experience for relevant future research. Code is available at: https://github.com/JindongGu/SimDis/

研究动机与目标

  • 解决小型自监督模型与监督模型之间的性能差距,该差距在模型规模减小时显著扩大。
  • 开发实用且高效的蒸馏基线,以提升小型自监督模型性能,且不依赖于记忆库或对比负样本等复杂组件。
  • 证明从大型教师模型蒸馏可显著提升小型学生模型在自监督学习中的性能。
  • 探索在最小训练设置(如无 LARS 优化器或 SyncBN)下的蒸馏有效性,以提升实用性并降低计算成本。

提出的方法

  • 提出一种离线蒸馏基线(SimDis-Off),其中大型教师模型首先使用 BYOL 进行预训练,随后用于监督小型学生模型的训练。
  • 引入一种在线蒸馏基线(SimDis-On),其中学生和教师模型同步训练,学生从教师模型的多个视图表征中学习。
  • 为教师和学生均采用孪生网络架构,学生被训练以预测来自自身网络和教师网络的归一化投影。
  • 采用学生输出的归一化预测与教师输出的归一化投影之间的均方误差损失,遵循 BYOL 协议。
  • 通过组合来自教师和学生网络的多个目标视图,实现多视图蒸馏,以提升优化稳定性和性能。
  • 通过在单台机器上使用 8 张 GPU 训练,消除了对 LARS 优化器和 SyncBN 的依赖,证明了在更简单、更实用设置下的鲁棒性。

实验结果

研究问题

  • RQ1从一个大型预训练教师模型进行简单知识蒸馏,能否显著提升小型自监督学生模型的性能?
  • RQ2在训练小型模型时,与离线蒸馏相比,在性能和计算成本方面,在线蒸馏表现如何?
  • RQ3当移除关键组件(如 LARS 和 SyncBN)时,蒸馏能在多大程度上提升小型自监督模型的性能?
  • RQ4从学生和教师网络同时进行多视图蒸馏,是否能提升学习效率和最终准确率?
  • RQ5蒸馏基线是否能在不使用记忆库或负样本(如先前方法 SEED 所用)的情况下实现最先进性能?

主要发现

  • SimDis-Off 在 1000 个周期后,使用 ResNet-18 在 ImageNet 线性评估中达到 67.18% 的 top-1 准确率,优于先前的 SOTA 方法(如 SEED)。
  • SimDis-On 在相同设置下达到 66.78% 的 top-1 准确率,表明在线蒸馏可在计算开销极低的情况下达到与离线蒸馏相当的性能。
  • 随着训练周期延长,离线与在线蒸馏之间的性能差距显著缩小:在 100 个周期时差距为 3.65%,在 1000 个周期时缩小至 1% 以内。
  • 多视图蒸馏(SimDis-On-7v)相比单视图提升了 2.57%,在增加可忽略的 FLOPs 的情况下,进一步缩小了与离线蒸馏的差距。
  • 在无 LARS 或 SyncBN 的设置下,SimDis-Off 达到 62.66% 的 top-1 准确率,SimDis-On 在使用全部 7 个视图时达到 63.52%,表明在最小化、实用化训练条件下仍具强大性能。
  • 学生模型在无蒸馏时达到 55.96% 的 top-1 准确率,经完整多视图蒸馏后提升至 63.52%,充分证明了所提蒸馏策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。