Skip to main content
QUICK REVIEW

[論文レビュー] Sampling to Distill: Knowledge Transfer from Open-World Data

Yuzheng Wang, Zhaoyu Chen|arXiv (Cornell University)|Jul 31, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用数 3
ひとこと要約

本稿では、生成モデルのコストを回避するために、元のデータ分布に近いオープンワールドのラベルなしデータを適応的サンプリングモジュールを用いて抽出し、低ノイズで対照的な構造的知識を活用することでドメインシフトを低減し、サンプル間の関係性を活用する、データフリー知識蒸留法であるオープンワールド・データ・サンプリング・ディスティルレーション(ODSD)を提案する。ODSDは、先行手法に比べてImageNetの性能を1.50%〜9.59%向上させ、最先端の精度を達成した。

ABSTRACT

Data-Free Knowledge Distillation (DFKD) is a novel task that aims to train high-performance student models using only the pre-trained teacher network without original training data. Most of the existing DFKD methods rely heavily on additional generation modules to synthesize the substitution data resulting in high computational costs and ignoring the massive amounts of easily accessible, low-cost, unlabeled open-world data. Meanwhile, existing methods ignore the domain shift issue between the substitution data and the original data, resulting in knowledge from teachers not always trustworthy and structured knowledge from data becoming a crucial supplement. To tackle the issue, we propose a novel Open-world Data Sampling Distillation (ODSD) method for the DFKD task without the redundant generation process. First, we try to sample open-world data close to the original data's distribution by an adaptive sampling module and introduce a low-noise representation to alleviate the domain shift issue. Then, we build structured relationships of multiple data examples to exploit data knowledge through the student model itself and the teacher's structured representation. Extensive experiments on CIFAR-10, CIFAR-100, NYUv2, and ImageNet show that our ODSD method achieves state-of-the-art performance with lower FLOPs and parameters. Especially, we improve 1.50\%-9.59\% accuracy on the ImageNet dataset and avoid training the separate generator for each class.

研究の動機と目的

  • 生成モデルの計算コストを回避するために、データフリー知識蒸留(DFKD)における生成処理を効率的なデータサンプリングに置き換えること。
  • 元のデータと代替データの間のドメインシフトを低減するため、元のデータ分布に類似した分布を持つオープンワールドデータをサンプリングすること。
  • 教師の予測から生じるラベルノイズを低減するため、サンプルデータの低ノイズ表現を学習すること。
  • 複数のデータ例間の暗黙の関係性を活用するため、構造的で対照的な知識蒸留を実現すること。
  • 元の学習データや生成コンponentに依存せずに、CIFAR-10、CIFAR-100、NYUv2、ImageNetで最先端の性能を達成すること。

提案手法

  • 教師の予測信頼度(sc_i)、外れ値度(so_i)、クラス密度(sd_i)の3つのスコアに基づいて、元のデータ分布に類似したオープンワールドのラベルなしデータを選択する適応的プロトタイプサンプリング(APS)モジュールを提案する。
  • 教師の予測から生じるラベルノイズを低減するため、低ノイズ表現を学習するためのノイズ除去対照的関係性蒸留(DCRD)モジュールを導入する。
  • 教師と学生のネットワーク間で対照的な構造的関係性を構築し、複数のデータ例間の暗黙の知識をモデル化する。
  • 知識蒸留(L_KD)、ノイズ正則化(L_n)、対照的関係性損失(L_c)を組み合わせたマルチ目的の訓練損失を採用し、学生の性能を向上させる。
  • 元の学習データにアクセスできない状況でも、事前学習済みの教師ネットワーク(例:ResNet-34/ResNet-50)を用いて特徴を抽出し、サンプリングと蒸留をガイドする。
  • t-SNE可視化を用いて、APSによるサンプリングで得られたデータの特徴分布が、ランダムまたはベースラインのサンプリング手法よりも元のデータドメインに近いことを確認する。

実験結果

リサーチクエスチョン

  • RQ1生成モデルを置き換えることで、性能を損なわずにデータフリー知識蒸留におけるデータサンプリングが可能かどうか。
  • RQ2元のデータが入手できない状況下で、サンプリングされたデータと元のデータ分布の間のドメインシフトをどのように低減できるか。
  • RQ3オープンワールドのラベルなしデータからの低ノイズ表現学習が、ラベルノイズの低減にどの程度寄与するか。
  • RQ4ラベルなしデータの間の構造的で相互に依存する関係性を活用することで、個々の例ごとの蒸留を超えた知識伝達が可能かどうか。
  • RQ5適応的サンプリングと対照的関係性蒸留を組み合わせることで、標準ベンチマークで最先端の性能が達成できるか。

主な発見

  • ODSDは、元の学習データや生成モデルを一切使用せず、CIFAR-10、CIFAR-100、NYUv2、ImageNetで最先端の精度を達成した。
  • ImageNetでは、既存のデータフリー知識蒸留手法に比べ、精度を1.50%〜9.59%向上させた。
  • アブレーションスタディの結果、3つのサンプリングスコア(sc_i、so_i、sd_i)のいずれかを削除すると性能が低下し、それぞれが分布の整合性に寄与していることが確認された。
  • すべての3つの訓練目的(L_KD、L_n、L_c)を組み合わせた場合が最良の性能を示し、50kおよび150kのサンプルデータ設定でそれぞれ75.26%および77.90%の精度を達成した。
  • t-SNE可視化により、APSによるサンプリングで得られたデータの特徴分布が、ランダムまたはベースラインのサンプリング手法よりも元のデータドメインに著しく近いことが確認された。
  • DCRDモジュールは、複数のデータ例間の構造的関係性をモデル化することで、ラベルノイズを効果的に低減し、蒸留性能を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。