Skip to main content
QUICK REVIEW

[論文レビュー] Anti-Distillation: Improving reproducibility of deep networks

Gil I. Shamir, Lorenzo Coviello|arXiv (Cornell University)|Oct 19, 2020
Machine Learning and Data Classification参考文献 31被引用数 6
ひとこと要約

本稿では、アンサンブルの出力のログティトを相関させることで、トレーニング中に各コンポonentが発散するよう促すことで、深層ニューラルネットワークの再現性を向上させる手法であるAnti-Distillation (AD) を提案する。トレーニング中にログティトの相関損失を適用することにより、同一のモデル間での予測差を低下させつつ、精度を損なわずに、ベンチマークおよび実世界のデータセットで予測差を最大75%まで低減する。

ABSTRACT

Deep networks have been revolutionary in improving performance of machine learning and artificial intelligence systems. Their high prediction accuracy, however, comes at a price of \emph{model irreproducibility\/} in very high levels that do not occur with classical linear models. Two models, even if they are supposedly identical, with identical architecture and identical trained parameter sets, and that are trained on the same set of training examples, while possibly providing identical average prediction accuracies, may predict very differently on individual, previously unseen, examples. \emph{Prediction differences\/} may be as large as the order of magnitude of the predictions themselves. Ensembles have been shown to somewhat mitigate this behavior, but without an extra push, may not be utilizing their full potential. In this work, a novel approach, \emph{Anti-Distillation\/}, is proposed to address irreproducibility in deep networks, where ensemble models are used to generate predictions. Anti-Distillation forces ensemble components away from one another by techniques like de-correlating their outputs over mini-batches of examples, forcing them to become even more different and more diverse. Doing so enhances the benefit of ensembles, making the final predictions more reproducible. Empirical results demonstrate substantial prediction difference reductions achieved by Anti-Distillation on benchmark and real datasets.

研究の動機と目的

  • 同一のデータでトレーニングされた同一のモデルが、個々の入力例に対して著しく異なる予測を出力するという、深層ネットワークにおける高い再現性の欠如を是正すること。
  • 医療など安全性が求められる応用分野において、一貫性のない予測が不可逆的な結果をもたらす可能性があるため、深層学習モデルの信頼性を向上させること。
  • 標準的な平均化を超えて、アンサンブルコンポーネント間の多様性を能動的に高めることで、アンサンブル性能を向上させること。
  • 深層ネットワークの高い精度を維持したまま再現性を向上させるトレーニング手法を開発すること。
  • Anti-Distillationによる出力の相関低下が、精度の低下を伴わずに予測差を低減することを実証的に検証すること。

提案手法

  • Anti-Distillationは、ミニバッチ単位でアンサンブルコンポーネントのログティトの相関を低下させる正則化損失を導入し、予測の多様性を促進する。
  • この手法は、アンサンブルメンバーのログティトに相関損失を適用し、ハイパーパrameter λ が相関低下の強度を制御する。
  • AD損失の3つのバリエーションを評価した:ログティトの相関損失(L_AD(C_z))、共分散損失(L_AD(Σ_z))、および差分に基づく損失(L′_AD)。
  • モデルアーキテクチャや推論に変更を加えず、標準的な最適化(例:AdaGrad)を用いてトレーニング中に適用する。
  • 同一のランダムシードを用いて初期化を一貫させ、MNISTおよび大規模な実世界のCTR予測データに対して評価した。
  • 再現性と性能を測定するために、予測差(PD)、相対的PD(Δ̃₁^r)、ログ損失、ランク損失といった指標を用いて評価した。

実験結果

リサーチクエスチョン

  • RQ1アンサンブルコンポーネントの出力を相関させることで、同一の深層ネットワーク間の予測差を低減できるか?
  • RQ2Anti-Distillationは、モデルの精度を低下させず、または訓練損失を増加させずに再現性を向上させるか?
  • RQ3AD正則化の強度(λ)が予測差とモデル性能に与える影響は何か?
  • RQ4確率ではなくログティトにADを適用することで、より良い再現性の向上が得られるか?
  • RQ5オンラインCTR予測のような大規模で実世界の深層学習システムにおいて、ADが顕著なPD低減を達成できるか?

主な発見

  • MNISTでは、Anti-Distillationにより予測差(PD)が最大75%低下したが、精度に低下は見られず、中程度のλ値でも同様の効果が得られた。
  • 2つのアンサンブルコンポーネントを用いたADは、ADなしの8コンポーネントよりも優れたPD性能を示し、ADによる多様性がアンサンブルサイズそのものよりも優れていることを示した。
  • 実世界のCTR予測データでは、単一モデルのPDが11.25%から3コンポーネントアンサンブルで6.5%に低下し、ADとλ=5を適用することでさらに2.88%まで低下した。
  • ログティトにADを適用することでPDが顕著に低下したが、確率にADを適用した場合では改善が得られず、出力層の選択の重要性が示された。
  • 入力初期化分散(s)のスケーリングによりPDが改善したが、効果は次第に減少し、λの値を大きくするとPDは改善したが、精度が低下した。
  • 共分散損失および差分に基づくAD損失は、相関損失ほどPDの改善効果が低く、後者はランク損失性能の維持にも寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。