Skip to main content
QUICK REVIEW

[論文レビュー] Entropy and mutual information in models of deep neural networks

Marylou Gabrié, Andre Manoel|Infoscience (Ecole Polytechnique Fédérale de Lausanne)|May 24, 2018
Statistical Mechanics and Entropy被引用数 14
ひとこと要約

本稿では、直交不変性を持つ重み行列を仮定したもとで、統計力学的手法を用いて深層ニューラルネットワークにおけるエントロピーおよび相互情報量を扱いやすい枠組みで計算する手法を提案する。2層ネットワークにガウス分布に従う重みを適用した場合、適応的補間法を用いてこれらの計算の正当性を厳密に証明し、合成実験を通じて、この設定下で圧縮と一般化の間の関係が依然として明確でないことが示された。

ABSTRACT

We examine a class of deep learning models with a tractable method to compute information-theoretic quantities. Our contributions are three-fold: (i) We show how entropies and mutual informations can be derived from heuristic statistical physics methods, under the assumption that weight matrices are independent and orthogonally-invariant. (ii) We extend particular cases in which this result is known to be rigorously exact by providing a proof for two-layers networks with Gaussian random weights, using the recently introduced adaptive interpolation method. (iii) We propose an experiment framework with generative models of synthetic datasets, on which we train deep neural networks with a weight constraint designed so that the assumption in (i) is verified during learning. We study the behavior of entropies and mutual informations throughout learning and conclude that, in the proposed setting, the relationship between compression and generalization remains elusive.

研究の動機と目的

  • 深層ニューラルネットワークにおけるエントロピーおよび相互情報量といった情報理論的量を扱いやすい方法で計算するためのフレームワークの開発。
  • 非線形性および高次元の重みを持つ深層学習モデルで用いられるヒューリスティックな統計力学の公式の厳密な基礎を確立すること。
  • 制御された合成実験を用いて、圧縮(相互情報量によって測定)が深層ネットワークの一般化を説明するのかを調査すること。
  • 制限された重み行列を満たす生成モデルに対する数値実験を通じて、理論的予測を検証すること。

提案手法

  • 成分ごとの非線形性と活性化におけるi.i.d.ノイズを有する確率的多層フィードフォワードニューラルネットワークモデルを用いる。
  • 直交不変性を持つ重み行列を仮定したもとで、統計力学のレプリカ法を適用し、エントロピーおよび相互情報量の閉形式表現を導出する。
  • 2層ネットワークにガウス分布に従う重みを適用した場合のレプリカ公式を厳密に証明するために、適応的補間法を用いる。
  • 学習中に直交不変性を持つ重み行列を維持するための重み制約を導入し、理論的仮定が学習全体にわたって満たされていることを保証する。
  • 制御された相関を持つ合成データセットを構築し、この制約下で深層ネットワークを学習させ、情報の流れを研究する。
  • $ n_0 \to \infty $、$ n_\ell / n_0 \to \alpha_\ell $ の高次元漸近解析を用い、測度の集中を用いて、実証的推定値のフラクチュエーションを制御する。

実験結果

リサーチクエスチョン

  • RQ1非線形的かつ高次元的な設定下で、エントロピーおよび相互情報量といった情報理論的量を深層ニューラルネットワークにおいて信頼性高く計算できるか?
  • RQ2レプリカ法による深層ネットワークにおける相互情報量の予測は、ガウス分布に従う重みを持つ2層モデルにおいて厳密に正当化されるか?
  • RQ3制御された条件下で、圧縮(層間の相互情報量の低下として測定)が、深層ネットワークの一般化性能と相関するか?
  • RQ4理論的仮定が満たされる設定において、トレーニング過程でのエントロピーおよび相互情報量はどのように変化するか?

主な発見

  • 適応的補間法を用いることで、ガウス分布に従うi.i.d.重みを持つ2層ネットワークにおける相互情報量およびエントロピーのレプリカ公式が厳密に成立することが証明された。
  • 制限された重み行列を有する合成データセットに対する数値実験を通じて、レプリカ法から導かれた理論的予測の正確性が確認された。
  • 理論的仮定を満たしても、トレーニング過程における相互情報量の変化は明確な圧縮-一般化関係を示さなかった。
  • 本研究では、層間の相互情報量がトレーニング中に一貫して減少しないことが判明し、圧縮が一般化の普遍的要因であるという仮説に疑問を呈した。
  • 実証的相互情報量推定値の分散は集中不等式により制御され、数値フレームワークの安定性が裏付けられた。
  • このフレームワークは重み行列の構造の役割を明確に分離できており、直交不変性を持つ重みが情報理論的量の正確な計算と検証を可能にすることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。