Skip to main content
QUICK REVIEW

[论文解读] Mosaicking to Distill: Knowledge Distillation from Out-of-Domain Data

Gongfan Fang, Yifan Bao|arXiv (Cornell University)|Oct 27, 2021
Adversarial Robustness in Machine Learning参考文献 64被引用 7
一句话总结

该论文提出 MosaicKD,一种新颖的知识蒸馏框架,通过利用分布外(OOD)数据中的对抗性拼贴局部模式,合成类分布内样本,实现从预训练教师模型到学生模型的有效知识迁移。该方法在图像分类和语义分割基准上达到最先进性能,显著优于现有的 OOD-KD 方法。

ABSTRACT

Knowledge distillation~(KD) aims to craft a compact student model that imitates the behavior of a pre-trained teacher in a target domain. Prior KD approaches, despite their gratifying results, have largely relied on the premise that \emph{in-domain} data is available to carry out the knowledge transfer. Such an assumption, unfortunately, in many cases violates the practical setting, since the original training data or even the data domain is often unreachable due to privacy or copyright reasons. In this paper, we attempt to tackle an ambitious task, termed as \emph{out-of-domain} knowledge distillation~(OOD-KD), which allows us to conduct KD using only OOD data that can be readily obtained at a very low cost. Admittedly, OOD-KD is by nature a highly challenging task due to the agnostic domain gap. To this end, we introduce a handy yet surprisingly efficacious approach, dubbed as~ extit{MosaicKD}. The key insight behind MosaicKD lies in that, samples from various domains share common local patterns, even though their global semantic may vary significantly; these shared local patterns, in turn, can be re-assembled analogous to mosaic tiling, to approximate the in-domain data and to further alleviating the domain discrepancy. In MosaicKD, this is achieved through a four-player min-max game, in which a generator, a discriminator, a student network, are collectively trained in an adversarial manner, partially under the guidance of a pre-trained teacher. We validate MosaicKD over {classification and semantic segmentation tasks} across various benchmarks, and demonstrate that it yields results much superior to the state-of-the-art counterparts on OOD data. Our code is available at \url{https://github.com/zju-vipa/MosaicKD}.

研究动机与目标

  • 解决传统知识蒸馏的实用限制,即知识迁移需要访问分布内数据。
  • 在仅拥有分布外(OOD)数据、由于隐私或版权限制无法获取分布内数据或原始训练数据的情况下,实现知识蒸馏。
  • 通过利用跨领域间共享的局部模式,缓解 OOD 数据与目标领域之间的严重领域差异。
  • 开发一种数据合成方法,在保持局部真实感的同时实现适合蒸馏的全局语义一致性。
  • 证明通过对抗性拼贴生成的合成数据可有效实现从预训练教师模型到学生模型的知识迁移。

提出的方法

  • MosaicKD 将知识蒸馏建模为包含生成器、判别器、学生网络和预训练教师的四人极小极大博弈。
  • 生成器通过重新组合从 OOD 数据中提取的局部块,合成类分布内图像,模拟马赛克拼贴过程。
  • 从 OOD 数据中拆解局部块,并重新组合形成具有逼真局部纹理和一致全局语义的合成样本。
  • 判别器区分真实 OOD 块与合成块,以强化局部真实感。
  • 学生网络在合成样本上模仿教师的预测,而教师提供软标签用于蒸馏。
  • 判别器的对抗性训练与知识蒸馏损失联合优化生成器和学生网络,以提升泛化能力。

实验结果

研究问题

  • RQ1当仅能访问分布外(OOD)数据而无法获取分布内数据或原始训练数据时,能否有效进行知识蒸馏?
  • RQ2能否利用不同领域间共享的局部模式,合成逼真的类分布内数据以用于蒸馏?
  • RQ3在局部块上操作的判别器进行对抗性训练,如何提升用于知识蒸馏的合成数据质量?
  • RQ4在领域差异较大的情况下,块大小对 OOD 知识蒸馏性能有何影响?
  • RQ5与现有无数据和无标签知识蒸馏方法相比,所提出的 MosaicKD 框架在性能和鲁棒性方面表现如何?

主要发现

  • MosaicKD 仅使用 OOD 数据,在图像分类和语义分割任务上达到最先进性能,显著优于现有方法。
  • 在 CIFAR-100 上,MosaicKD 使用 ResNet-16-2 学生模型达到 70.41% 的准确率,领先次佳方法超过 5 个百分点。
  • 在 Places365 上,MosaicKD 使用 Wide ResNet-40-2 模型达到 69.41% 的准确率,展现出在高领域偏移下的强大泛化能力。
  • 消融实验表明,若移除块学习,将无法生成正确的语义类别;若移除判别器或对抗性训练,性能会下降。
  • 较小的块尺寸在高度偏离的 OOD 数据(如 SVHN)中更有效,表明当领域差异较大时,局部相似性更为关键。
  • 训练效率分析显示,MosaicKD 的收敛速度优于 DFQ 和原始 KD,表明其优化动态更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。