Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Bayesian Posterior Expectation Distillation for Deep Neural Networks

Meet P. Vadera, Brian Jalaian|arXiv (Cornell University)|May 16, 2020
Adversarial Robustness in Machine Learning参考文献 31被引用数 4
ひとこと要約

本稿では、オンラインモンテカルロサンプリングを用いて任意の事後分布の期待値(予測分布や期待エントロピーなど)をコン act な学生モデルに蒸留する、一般化されたベイジアン事後分布期待値蒸留フレームワークを提案する。この手法は、分布外検出や不確実性ランク付けといった下流の不確実性タスクを改善し、多様なアーキテクチャとデータセットにおいて、蒸留の忠実度と実用的有用性の両面で先行手法を上回る。

ABSTRACT

In this paper, we present a general framework for distilling expectations with respect to the Bayesian posterior distribution of a deep neural network classifier, extending prior work on the Bayesian Dark Knowledge framework. The proposed framework takes as input "teacher" and student model architectures and a general posterior expectation of interest. The distillation method performs an online compression of the selected posterior expectation using iteratively generated Monte Carlo samples. We focus on the posterior predictive distribution and expected entropy as distillation targets. We investigate several aspects of this framework including the impact of uncertainty and the choice of student model architecture. We study methods for student model architecture search from a speed-storage-accuracy perspective and evaluate down-stream tasks leveraging entropy distillation including uncertainty ranking and out-of-distribution detection.

研究の動機と目的

  • 過剰に自信を持つ予測を出力し、不確実性のキャリブレーションが悪い点推定型ディープラーニングモデルの限界を解消すること。
  • 予測分布の蒸留にとどまらず、期待エントロピーなどの一般化された事後分布の期待値を含めたベイジアンダークナレッジの拡張。
  • 体系的なアーキテクチャ探索を通じて、学生モデルにおける速度・ストレージ・精度のトレードオフを細かく制御すること。
  • 分布外検出や不確実性ランク付けといった、不確実性定量化を要する下流タスクにおける一般化された事後分布蒸留の実用性を評価すること。
  • 蒸留性能が学生モデルの容量に極めて敏感であり、アーキテクチャ探索によって最適なトレードオフを効果的に同定できることを示すこと。

提案手法

  • 教師モデル(事後分布重みのモンテカルロサンプルとして表現される)と学生モデルのアーキテクチャを入力として受ける。
  • 教師の事後分布から逐次的にモンテカルロサンプルを生成することで、一般化された事後分布期待値(例えば、事後予測分布や期待エントロピー)をオンラインで蒸留する。
  • 教師の事後分布の期待出力を模倣するように学生モデルを訓練する。知識蒸留を用い、教師と学生の期待値の乖離を最小化する損失関数を適用する。
  • 幅乗数戦略を用いたアーキテクチャ探索により、モデルサイズ、推論速度、精度のバランスをとる学生モデルの容量範囲を探索する。
  • 合計不確実性と知識不確実性を含む複数の不確実性統計量の蒸留をサポートし、下流の不確実性対応タスクを可能にする。
  • 標準的な蒸留メトリクスに加え、分布外検出やnDCGベースの不確実性ランク付けといった下流タスクを用いてフレームワークを評価する。

実験結果

リサーチクエスチョン

  • RQ1予測分布とエントロピー期待値の両面において、一般化された事後分布期待値蒸留はベイジアンダークナレッジと比較して、どの程度の蒸留性能を示すか?
  • RQ2蒸留性能は学生モデルのアーキテクチャの選択にどの程度敏感であり、アーキテクチャ探索によって速度・ストレージ・精度の最適なトレードオフを効果的に同定できるか?
  • RQ3エントロピーに基づく蒸留は、分布外検出や不確実性ランク付けといった下流の不確実性対応タスクの性能向上に寄与するか?
  • RQ4Malininら(2020)のEnD 2手法と比較して、本フレームワークは蒸留忠実度と下流タスク性能の両面で優れているか?
  • RQ5不確実性分解(例:合計不確実性対知識不確実性)の影響は、不確実性ベースの応用における蒸留の有効性にどのように現れるか?

主な発見

  • 提案されたGPEDフレームワークは、75%の分布外検出設定においてEnD 2手法の適応を上回り、全テストデータセットおよびモデルの組み合わせで高いAUROCスコアを達成した。
  • 不確実性ランク付けにおいて、GPEDは91%の評価設定でEnD 2を上回るnDCG@20スコアを達成し、相対的な不確実性順序の保持が優れていることを示した。
  • 蒸留性能は学生モデルの容量に極めて敏感であり、学生モデルが薄すぎたり深すぎたりすると性能が著しく低下した。
  • 幅乗数を用いたアーキテクチャ探索により、速度・ストレージ・精度のトレードオフ空間が明確に露わになり、より優れた性能-計算バランスを達成する学生モデルが同定された。
  • 本フレームワークは優れた一般化性能を示し、蒸留されたエントロピー統計量を用いて、分布外検出および不確実性ランク付けタスクで最先端の性能を達成した。
  • 期待エントロピーを蒸留ターゲットとして用いることで、効果的な不確実性分解が可能となり、アクティブラーニングや異常検出における蒸留モデルの有用性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。