Skip to main content
QUICK REVIEW

[論文レビュー] On Dropout, Overfitting, and Interaction Effects in Deep Neural Networks

Ben Lengerich, Eric P. Xing|arXiv (Cornell University)|May 4, 2021
Adversarial Robustness in Machine Learning参考文献 3被引用数 12
ひとこと要約

この論文は、ドロップアウトがドロップアウト下での生存確率を指数関数的に低下させることで、高次相互作用を本質的に正則化することを明らかにしている。これにより、複雑な相互作用に対する選択的正則化が生じる。入力ドロップアウトに関しては解析的にこれを証明し、活性化ドロップアウトに関しては実験的に確認した。その結果、偽の高次相互作用を抑えるために高いドロップアウト率が必要であり、無限のデータがあってもドロップアウトに基づくサリエンシー手法はバイアスを持つことが分かった。

ABSTRACT

We examine Dropout through the perspective of interactions. Given N variables, there are O(N2) possible pairwise interactions, O(N3) possible 3-way interactions, i.e. O(Nk) possible interactions of k variables. Conversely, the probability of an interaction of k variables surviving Dropout at rate p is O((1−p)k). In this paper, we show that these rates cancel, and as a result, Dropout selectively regularizes against learning higher-order interactions. We prove this new perspective analytically for Input Dropout and empirically for Activation Dropout. This perspective on Dropout has several practical implications: (1) higher Dropout rates should be used when we need stronger regularization against spurious high-order interactions, (2) caution must be used when interpreting Dropout-based feature saliency measures, and (3) networks trained with Input Dropout are biased estimators, even with infinite data. We also compare Dropout to regularization via weight decay and early stopping and find that it is difficult to obtain the same regularization against high-order interactions with these methods.

研究の動機と目的

  • 特徴相互作用正則化の観点からドロップアウトのインダクティブバイアスを理解すること。
  • ドロップアウト率がk次相互作用の生存確率に与える影響を分析すること。
  • この相互作用バイアスの実用的影響をモデルの解釈可能性とトレーニングに評価すること。
  • ドロップアウトによる高次相互作用の正則化を、重み減衰と早期停止と比較すること。

提案手法

  • 組み合わせ確率を用いた入力ドロップアウト下での相互作用生存確率の理論的分析。
  • ドロップアウト下でのk次相互作用の生存率O((1−p)^k)の導出。
  • 制御された実験を通じて活性化ドロップアウトにおける相互作用正則化効果の実証的検証。
  • ドロップアウト、重み減衰、早期停止の間で、相互作用の複雑さに対する正則化効果の比較。
  • 特徴サリエンシー分析を用いて、ドロップアウトに基づくアトリビューション手法のバイアスを評価。
  • 入力ドロップアウトが無限のデータでもバイアス推定器を生じることの数学的証明。

実験結果

リサーチクエスチョン

  • RQ1ドロップアウトは、深層ネットワークにおけるk次相互作用の生存確率にどのように影響するか?
  • RQ2ドロップアウトは、低次相互作用と比較して、高次相互作用をどれほど選択的に正則化するか?
  • RQ3重み減衰や早期停止は、ドロップアウトと同等の高次相互作用に対する正則化を達成できるか?
  • RQ4ドロップアウトが導入する相互作用バイアスは、特徴サリエンシー解釈の信頼性にどのように影響するか?
  • RQ5無限のデータのもとで、入力ドロップアウトで訓練されたモデルは一貫した推定器か?

主な発見

  • ドロップアウト下でのk次相互作用の生存確率はO((1−p)^k)であり、高次相互作用が指数関数的に抑制される。
  • 偽の高次相互作用を強く正則化するためには、高いドロップアウト率が必要である。
  • 無限のトレーニングデータがあっても、ドロップアウトに基づく特徴サリエンシー測定はバイアス推定器である。
  • 入力ドロップアウトで訓練されたネットワークは、相互作用抑制効果によりバイアス推定器である。
  • 重み減衰と早期停止は、ドロップアウトと同等の高次相互作用に対する正則化を達成できない。
  • ドロップアウトの相互作用正則化効果は、入力ドロップアウトに関しては解析的に証明可能であり、活性化ドロップアウトでは実証的に観察可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。