Skip to main content
QUICK REVIEW

[論文レビュー] Neural networks are a priori biased towards Boolean functions with low entropy

Chris Mingard, Joar Skalse|arXiv (Cornell University)|Sep 25, 2019
Neural Networks and Applications参考文献 31被引用数 11
ひとこと要約

この論文は、ランダムな重み初期化を持つ1層パーセプトロンが、エントロピーが低いブール関数へ強い事前バイアスを示すことを証明している。具体的には、t 個の入力を1と分類する関数を生成する確率は、すべての t < 2^n に対して一様に 2^(-n) である。この低エントロピー関数への内因的バイアスは、ReLU層を追加することで単調に強化され、過パラメータ化された設定における一般化の背後にある根本的な帰納的バイアスを示している。

ABSTRACT

Understanding the inductive bias of neural networks is critical to explaining their ability to generalise. Here, for one of the simplest neural networks -- a single-layer perceptron with n input neurons, one output neuron, and no threshold bias term -- we prove that upon random initialisation of weights, the a priori probability $P(t)$ that it represents a Boolean function that classifies t points in ${0,1}^n$ as 1 has a remarkably simple form: $P(t) = 2^{-n}$ for $0\leq t &lt; 2^n$. Since a perceptron can express far fewer Boolean functions with small or large values of t (low entropy) than with intermediate values of t (high entropy) there is, on average, a strong intrinsic a-priori bias towards individual functions with low entropy. Furthermore, within a class of functions with fixed t, we often observe a further intrinsic bias towards functions of lower complexity. Finally, we prove that, regardless of the distribution of inputs, the bias towards low entropy becomes monotonically stronger upon adding ReLU layers, and empirically show that increasing the variance of the bias term has a similar effect.

研究の動機と目的

  • 初期化時の関数上での事前確率分布を分析することで、ニューラルネットワークの帰納的バイアスを理解すること。
  • 過パラメータ化されているにもかかわらず深層ニューラルネットワークがなぜうまく一般化するのかを、パラメータ-関数写像に焦点を当てて調査すること。
  • アーキテクチャの選択(例:ReLU層の追加やバイアスの分散調整)が、低エントロピー関数へのバイアスに与える影響を定量化すること。
  • クラス不均衡な状況における学習に、このバイアスが与える影響を検討すること。特に、低エントロピー関数がレアクラス検出と整合性を示す可能性がある。

提案手法

  • ランダムな重み初期化下で、1層パーセプトロンが t 個の入力を1と分類する関数を表す確率 P(t) = 2^(-n) を正確に導出する。
  • 幾何学的および組合せ論的議論を用いて、低 t(低エントロピー)関数は中間 t の関数に比べて指数的に少ないが、一様な P(t) のため、事前確率としては同様に確率的であることを示す。
  • ReLU層を追加することで、入力分布に依存せずに、低エントロピー関数へのバイアスが単調に増大することを解析的に証明する。
  • バイアス項の分散が関数エントロピーへのバイアスに与える影響を実験的に調査し、分散を増やすことで低エントロピー関数へのバイアスが強化されることを示す。
  • MNIST および EMNIST に対して、バイアス項をずらして初期関数エントロピーを調整する実験を行い、テスト精度と感度を測定する。
  • ガウス過程近似を用いて、より深いネットワークにおける関数空間へのバイアスを研究し、理論的発見と整合するスケーリング行動を観察する。

実験結果

リサーチクエスチョン

  • RQ1ランダムに初期化された1層パーセプトロンが、ブール関数に対してどの程度の事前確率分布を示すか?
  • RQ2このような関数が組合せ的に稀であるにもかかわらず、なぜニューラルネットワークが低エントロピー関数への強い帰納的バイアスを示すのか?
  • RQ3ReLU層の追加が、低エントロピー関数への帰納的バイアスにどのように影響するか?
  • RQ4バイアス項の分散を調整する、あるいはバイアス項をずらすことで、ネットワークの初期関数空間バイアスやその後の学習性能にどの程度の影響を与えることができるか?
  • RQ5このエントロピーバイアスは、クラス不均衡分類タスクにおける学習にどのような影響を与えるか?

主な発見

  • 1層パーセプトロンが t 個の入力を1と分類する事前確率 P(t) は、すべての t ∈ [0, 2^n) に対して正確に 2^(-n) であり、すべての可能な t 値に対して一様に確率的であることを示している。
  • 指数的にまれであるにもかかわらず、低エントロピー関数(t が小さいか大きい場合)は、一様な P(t) 分布のおかげで中間エントロピー関数よりも事前確率が高くなる。
  • ReLU層を追加することで、入力分布に依存せず、低エントロピー関数へのバイアスが単調に増大することが解析的に証明された。
  • 実験的に、バイアス項の分散を増やすことで、低エントロピー関数へのバイアスが強化されることが示され、調整可能な帰納的バイアスであることが示唆された。
  • MNIST や EMNIST などのクラス不均衡データセットにおいて、バイアス項をずらして初期関数エントロピー(t)を増やすことで、特にReLU活性化関数を用いた全結合ネットワークでは、テスト精度と感度が向上した。
  • 精度と感度の最適なずらしハイパーパrameterは、真のクラス不均衡比(例:MNIST では1:10)と一致しており、バイアスの調整が帰納的バイアスをターゲット関数と一致させられることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。