Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Estimators Show Information Compression in Deep Neural Networks

Ivan Chelombiev, Conor Houghton|arXiv (Cornell University)|Feb 24, 2019
Neural Networks and Applications被引用数 8
ひとこと要約

本稿では、非飽和活性化関数を用いる深層ニューラルネットワークにおける情報圧縮の可視化を可能にする、適応的相互情報推定技術を導入する。従来、圧縮が存在しないと考えられていたが、本研究の主な発見は、一般化と相関する圧縮は最終的なソフトマックス層でのみ観察され、L2正則化が全層にわたり圧縮を強化することである。

ABSTRACT

To improve how neural networks function it is crucial to understand their learning process. The information bottleneck theory of deep learning proposes that neural networks achieve good generalization by compressing their representations to disregard information that is not relevant to the task. However, empirical evidence for this theory is conflicting, as compression was only observed when networks used saturating activation functions. In contrast, networks with non-saturating activation functions achieved comparable levels of task performance but did not show compression. In this paper we developed more robust mutual information estimation techniques, that adapt to hidden activity of neural networks and produce more sensitive measurements of activations from all functions, especially unbounded functions. Using these adaptive estimation techniques, we explored compression in networks with a range of different activation functions. With two improved methods of estimation, firstly, we show that saturation of the activation function is not required for compression, and the amount of compression varies between different activation functions. We also find that there is a large amount of variation in compression between different network initializations. Secondary, we see that L2 regularization leads to significantly increased compression, while preventing overfitting. Finally, we show that only compression of the last layer is positively correlated with generalization.

研究の動機と目的

  • 非飽和活性化関数(例:ReLU)を用いる深層ニューラルネットワークにおける情報圧縮に関する、矛盾する経験的証拠を解消すること。特に、従来、圧縮が存在しないとされてきた点を対象とする。
  • 隠れ層活性化の分布の変動に敏感な、より強固で適応的な相互情報推定手法の開発。特に、有界でない活性化関数に適した手法を目的とする。
  • 異なる活性化関数、ネットワーク初期化、正則化手法における圧縮の有無と程度を調査すること。
  • 圧縮と一般化性能の関係、特に個々のネットワーク層にわたる関係を特定すること。

提案手法

  • 隠れ層活性化の分布に適応する、新たなカーネル密度推定(KDE)およびビニングベースの相互情報推定器を提案。非飽和関数に対する感度向上を目的とする。
  • 微分エントロピーおよび相互情報の近似に、追加ノイズとビニング手法を用い、決定的DNNにおける無限大の値を回避する。
  • 圧縮スコア指標を導入:$\text{Score} = \frac{1}{N}\sum_{k=1}^{N}(1 - l_{k,M}/\max_{i\in\mathit{E}}(\mathbf{L}_{k,i}))$、ここで$\mathbf{L}$は層およびエポックにわたる$I(T,X)$の値を含む。
  • 異なる活性化関数(ReLU、ソフトプラス、ELUなど)を用いた全結合ネットワークを、複数のランダム初期化およびL2正則化の有無にかかわらず学習。
  • 推定された$I(T,X)$および$I(T,Y)$を用いて、情報平面における学習ダイナミクスを可視化。エポックごとの変化を追跡。
  • 50回のネットワーク初期化にわたる層ごとの圧縮スコアとテスト精度の相関関係を評価し、一般化との関連を検証。

実験結果

リサーチクエスチョン

  • RQ1非飽和活性化関数(例:ReLU)を用いる深層ニューラルネットワークにおいて、従来の報告とは対照的に、情報圧縮が生じるのか?
  • RQ2ネットワーク初期化は、層にわたる圧縮の度合いや存在にどのように影響するか?
  • RQ3L2正則化は、隠れ層における情報圧縮をどの程度誘発または強化するのか?
  • RQ4個々の隠れ層における圧縮と一般化性能の間に相関関係があるか?
  • RQ5どの層が圧縮とテスト精度の間に有意な関係を示すか?

主な発見

  • 適応的相互情報推定により、非飽和活性化関数(例:ReLU)を用いるネットワークにおいても情報圧縮が生じることが明らかになった。これは、従来、飽和が必須であるとされてきた主張に反する。
  • 異なる活性化関数間で圧縮の度合いに顕著な差が認められ、関数形が類似しているにもかかわらず、ソフトプラスおよびセンター付きソフトプラスでは圧縮スコアに顕著な差が生じた。
  • 圧縮はネットワーク初期化に極めて敏感であり、一部の初期化では初期学習段階から強い圧縮が観察された一方、他の初期化ではほとんど圧縮が見られなかった。
  • L2正則化により、全層にわたり顕著に圧縮が増加した。相互情報が情報平面の一点に集中する傾向を示し、強い圧縮を示している。
  • 一般化精度と有意に正の相関関係を示すのは、唯一最終的なソフトマックス層での圧縮に限られ、隠れ層の圧縮はテスト性能と相関しなかった。
  • 情報ボトルネックはネットワーク全体に一様に実装されていない。一般化は隠れ層の圧縮によって駆動されるのではなく、むしろ最終層の圧縮に特異的に関連している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。