Skip to main content
QUICK REVIEW

[論文レビュー] Subclass Distillation

Rafael Rios Müller, Simon Kornblith|arXiv (Cornell University)|Feb 10, 2020
Process Optimization and Integration参考文献 17被引用数 8
ひとこと要約

本稿では、低クラスデータセットにおける知識蒸留の効率を向上させるために、教師ネットワークが各クラスを複数の学習済みサブクラスに分割するsubclass distillationという手法を提案する。対照的補助損失を用いてこれらのサブクラス確率から蒸留することで、学生モデルは直接二値ラベルの教師なしでも、より良い一般化性能と高速な収束を達成する。

ABSTRACT

After a large "teacher" neural network has been trained on labeled data, the probabilities that the teacher assigns to incorrect classes reveal a lot of information about the way in which the teacher generalizes. By training a small "student" model to match these probabilities, it is possible to transfer most of the generalization ability of the teacher to the student, often producing a much better small model than directly training the student on the training data. The transfer works best when there are many possible classes because more is then revealed about the function learned by the teacher, but in cases where there are only a few possible classes we show that we can improve the transfer by forcing the teacher to divide each class into many subclasses that it invents during the supervised training. The student is then trained to match the subclass probabilities. For datasets where there are known, natural subclasses we demonstrate that the teacher learns similar subclasses and these improve distillation. For clickthrough datasets where the subclasses are unknown we demonstrate that subclass distillation allows the student to learn faster and better.

研究の動機と目的

  • 二値分類のような限られたクラス情報が少ない低クラスシナリオにおいて、従来の知識蒸留が非効率である問題に対処すること。
  • データ内に隠されたサブクラス構造を活用することで、リソース制約のあるアプリケーションにおけるモデルの一般化性能と学習効率を向上させること。
  • 事前にサブクラス構造を知らなくても、二値ラベルのみで学習する教師が意味的に意味のあるサブクラスを学習できるようにすること。
  • 学生が教師のクラス内サブクラス確率を模倣することで、ターゲットクラスの明示的教師なしでも二値分類タスクを間接的に学習できることを示すこと。

提案手法

  • 元のクラスごとにs個のサブクラスのログィットを出力する深層教師ネットワークを訓練し、最終的なクラス確率はサブクラス確率の合計によって得る。
  • 各例をモーメンタム更新されたキュー内で自分自身と対比することで、サブクラスの多様性と信頼性を高める補助的対照損失を導入する。
  • サブクラスログィットのソフトマックスに温度スケーリングを適用し、サブクラス間の相対的差を強調しつつ、クラス内関係を維持する。
  • 元のクラスラベルと教師のサブクラス確率分布を模倣する2つのクロスエントロピー損失を用いて学生ネットワークを訓練する。
  • 教師のモーメンタムエンコーダーをモーメンタム更新することで、訓練中にサブクラス表現の学習を安定化させる。
  • 知られている(CIFAR-2x5, MNIST-2x5)および未知の(CelebA, Criteo)サブクラス構造を持つデータセットに対して、エンドツーエンドで本手法を適用し、一般化性能と効率を評価する。

実験結果

リサーチクエスチョン

  • RQ1二値ラベルのみが与えられた二値分類タスクにおいて、教師ネットワークが意味的に意味のあるサブクラスを発見できるか?
  • RQ2サブクラス確率からの蒸留は、従来の蒸留やペナルティレイヤー蒸留よりも優れた一般化性能をもたらすか?
  • RQ3学生が教師のクラス内サブクラス確率の相対的関係を模倣することで、ターゲットクラスの直接的教師なしでも二値分類タスクを学習できるか?
  • RQ4データが限られている場合やサブクラス構造が未知の場合、サブクラス蒸留は学習速度と性能にどのように影響を与えるか?
  • RQ5学習されたサブクラスは、現実世界のデータセットにおける既知のまたは自然なデータ構造とどの程度相関しているか?

主な発見

  • CIFAR-2x5では、教師がサブクラス学習を通じて元のCIFAR-10クラスを効果的に発見し、1.83%の誤差率を達成した。これは従来の蒸留やペナルティレイヤー蒸留を上回る性能であった。
  • CelebAでは、教師が学習したサブクラスが、訓練されていない他の二値ラベルと強く相関しており、意味的に意味のあるサブクラスであり、蒸留性能の向上が示された。
  • Criteoクリック予測データセットでは、サブクラス蒸留が高速な収束と優れた性能を達成した。特に、学生が全データにアクセスできない場合に顕著であった。
  • MNIST-2x5では、学生が二値ラベルを一度も見ることなく、相対的サブクラス確率のみを学習することで、2.06% ± 0.18の誤差率を達成した。これはターゲットタスクの間接的学習を示している。
  • 補助的対照損失は、多様で信頼性の高いサブクラス予測を促進し、複数のデータセットでサブクラス構造が意味的に一貫していることが確認された。
  • 特にデータが少ない状況では、サブクラス蒸留が標準蒸留よりも多くのビットを1例あたり伝えることができ、情報伝達効率が高かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。