Skip to main content
QUICK REVIEW

[論文レビュー] Mosaicking to Distill: Knowledge Distillation from Out-of-Domain Data

Gongfan Fang, Yifan Bao|arXiv (Cornell University)|Oct 27, 2021
Adversarial Robustness in Machine Learning参考文献 64被引用数 7
ひとこと要約

この論文は、オーディエンス外(OOD)データからのローカルパターンを敵対的モザイキングによって再構成することで、ドメイン内に似たサンプルを合成し、事前学習済みの教師モデルから学生モデルへの有効な知識伝達を可能にする、MosaicKDと呼ばれる新しい知識蒸留フレームワークを提案する。この手法は、分類およびセマンティックセグメンテーションのベンチマークで最先端の性能を達成し、既存のOOD-KD手法を著しく上回る。

ABSTRACT

Knowledge distillation~(KD) aims to craft a compact student model that imitates the behavior of a pre-trained teacher in a target domain. Prior KD approaches, despite their gratifying results, have largely relied on the premise that \emph{in-domain} data is available to carry out the knowledge transfer. Such an assumption, unfortunately, in many cases violates the practical setting, since the original training data or even the data domain is often unreachable due to privacy or copyright reasons. In this paper, we attempt to tackle an ambitious task, termed as \emph{out-of-domain} knowledge distillation~(OOD-KD), which allows us to conduct KD using only OOD data that can be readily obtained at a very low cost. Admittedly, OOD-KD is by nature a highly challenging task due to the agnostic domain gap. To this end, we introduce a handy yet surprisingly efficacious approach, dubbed as~ extit{MosaicKD}. The key insight behind MosaicKD lies in that, samples from various domains share common local patterns, even though their global semantic may vary significantly; these shared local patterns, in turn, can be re-assembled analogous to mosaic tiling, to approximate the in-domain data and to further alleviating the domain discrepancy. In MosaicKD, this is achieved through a four-player min-max game, in which a generator, a discriminator, a student network, are collectively trained in an adversarial manner, partially under the guidance of a pre-trained teacher. We validate MosaicKD over {classification and semantic segmentation tasks} across various benchmarks, and demonstrate that it yields results much superior to the state-of-the-art counterparts on OOD data. Our code is available at \url{https://github.com/zju-vipa/MosaicKD}.

研究の動機と目的

  • 従来の知識蒸留が、知識伝達のためのドメイン内データへのアクセスを必要とするという実用的制限を解消すること。
  • プライバシーまたは著作権制約のため、ドメイン外(OOD)データしか入手できない状況でも知識蒸留を可能にすること。
  • ドメイン間で共有されるローカルパターンを活用することで、OODデータとターゲットドメインの間の顕著なドメインギャップを克服すること。
  • 局所的なリアルさを保ちつつ、蒸留に適したグローバルな意味的整合性を実現するデータ合成手法を開発すること。
  • 敵対的モザイキングによって生成された合成データが、事前学習済み教師モデルから学生モデルへの知識伝達を有効に可能であることを実証すること。

提案手法

  • MosaicKDは、生成器、識別器、学生ネットワーク、および事前学習済み教師の4者によるミニマックスゲームとして知識蒸留を定式化する。
  • 生成器は、OODデータから抽出した局所パッチを再構成することで、ドメイン内に似た画像を合成する。これはモザイクタイルの模倣に似ている。
  • OODデータから分解された局所パッチを再編成し、現実的な局所テクスチャと整合性のあるグローバルな意味的構造を持つ合成サンプルを生成する。
  • 識別器は、本物のOODパッチと合成パッチを区別することで、局所的なリアルさを強制する。
  • 学生ネットワークは、合成サンプル上で教師の予測を模倣するように訓練され、教師は蒸留用のソフトラベルを提供する。
  • 識別器による敵対的訓練と知識蒸留損失が共同で最適化され、生成器と学生ネットワークの一般化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン内データや元の学習データにアクセスできない状況で、OODデータのみを用いて知識蒸留を効果的に行うことは可能か?
  • RQ2異なるドメイン間で共有される局所パターンを活用して、蒸留に適した現実的なドメイン内に似たデータを合成することは可能か?
  • RQ3局所パッチに作用する識別器による敵対的訓練は、知識蒸留に適した合成データの品質をどのように向上させるか?
  • RQ4パッチサイズは、特にドメイン差が著しい状況下で、OOD知識蒸留の性能にどのような影響を与えるか?
  • RQ5既存のデータフリーおよびラベルなし知識蒸留手法と比較して、提案されたMosaicKDフレームワークは性能および頑健性においてどのように差をつけるか?

主な発見

  • MosaicKDは、ドメイン内データにアクセスできない状況でも、画像分類およびセマンティックセグメンテーションタスクで最先端の性能を達成し、既存手法を著しく上回る。
  • CIFAR-100では、ResNet-16-2を学生モデルとして使用した場合、70.41%の正確度を達成し、次に良い手法よりも5ポイント以上優れている。
  • Places365では、Wide ResNet-40-2を用いた場合、69.41%の正確度を達成し、ドメインシフトが著しい状況下でも強い一般化性能を示している。
  • アブレーションスタディの結果、パッチ学習を除去すると正しい意味的カテゴリの生成に失敗する一方、識別器や敵対的訓練を除去すると性能が低下する。
  • より小さなパッチサイズは、顕著に異なるOODデータ(例:SVHN)に対してより効果的であり、ドメイン差が大きい状況では局所的な類似性がより重要であることを示している。
  • 学習効率の分析から、MosaicKDはDFQやヴァーチャルKDよりも収束が速く、最適化ダイナミクスが改善されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。