Skip to main content
QUICK REVIEW

[論文レビュー] Deep Deterministic Information Bottleneck with Matrix-based Entropy Functional

Xi Yu, Shujian Yu|arXiv (Cornell University)|Jan 31, 2021
Adversarial Robustness in Machine Learning参考文献 35被引用数 6
ひとこと要約

本稿では、変分推論や分布仮定を必要とせず、行列ベースのリーマンのα順序エントロピー関数を用いて深層ニューラルネットワークにおける情報ボトルネック原理を直接最適化する、新たな手法である深層決定的情報ボトルネック(DIB)を提案する。DIBは、MNISTおよびCIFAR-10において、VIBや他の正則化手法を上回る最先端の汎化性能と耐性を達成しており、特に adversarial 攻撃下でも優れた性能を示す。

ABSTRACT

We introduce the matrix-based Renyi's $α$-order entropy functional to parameterize Tishby et al. information bottleneck (IB) principle with a neural network. We term our methodology Deep Deterministic Information Bottleneck (DIB), as it avoids variational inference and distribution assumption. We show that deep neural networks trained with DIB outperform the variational objective counterpart and those that are trained with other forms of regularization, in terms of generalization performance and robustness to adversarial attack.Code available at https://github.com/yuxi120407/DIB

研究の動機と目的

  • 高次元の深層学習における相互情報量の計算の課題に対処するため、変分推論に代わる決定的で微分可能なエントロピー推定器を導入すること。
  • 新たな行列ベースのリーマンのα順序エントロピー関数を用いて、深層ニューラルネットワークにおける情報ボトルネック原理を直接最適化すること。
  • 従来の変分的および正則化に基づく手法と比較して、モデルの汎化性能と adversarial 攻撃に対する耐性を向上させること。
  • 情報ボトルネック目的関数の決定的パrameterizationが、表現学習において優れた性能を発揮できることを示すこと。

提案手法

  • 本手法は、カーネル埋め込みされたデータペアから構築された正規化されたグラム行列の固有値を用いて定義される行列ベースのリーマンのα順序エントロピー関数を導入する。
  • このエントロピー関数は微分可能であり、変分近似を用いずに、IB目的関数をエンドツーエンドでバックプロパゲーション可能である。
  • VIBで用いられる変分下界に代わり、決定的エントロピー推定器を用いてIBラグランジアンを直接最適化する。
  • ボトルネック層を表現Tとして扱い、相互情報量項を行列ベースのエントロピー関数で計算することで、深層ニューラルネットワークに適用する。
  • 分布仮定や変分推論を回避することで、IB原理に基づく深層ネットワークの直接学習が可能になる。
  • 標準的な深層学習アーキテクチャ(例:MNIST用に784-1024-1024-256-10、CIFAR-10用にVGG16)を用い、Adam/SGD最適化で実装される。

実験結果

リサーチクエスチョン

  • RQ1情報ボトルネック枠組みにおける深層学習において、変分推論に代わる決定的で微分可能なエントロピー推定器を用いることは可能か?
  • RQ2行列ベースのリーマンエントロピーを用いてIB目的関数を直接最適化することで、VIBや他の正則化手法と比較して汎化性能と耐性が向上するか?
  • RQ3行列ベースのリーマンエントロピー関数は、分布仮定を必要とせずに深層ニューラルネットワークの学習に効果的に用いることができるか?
  • RQ4adversarial 攻撃下におけるDIBの性能は、VIBおよび標準的な正則化手法と比較してどうなるか?

主な発見

  • MNISTでは、DIBが1.13%のテスト誤差を達成し、VIB(1.17%)や他の正則化手法を上回った。
  • CIFAR-10では、VGG16を用いてDIBがテスト誤差を5.66%まで低下させ、ベースラインVGG16(7.36%)やVIB(9.31%)を上回った。
  • FGSM adversarial 攻撃に対して、特にCIFAR-10において顕著な耐性向上を示し、VIB、ラベルスムージング、信頼性ペナルティを上回った。
  • DIBで学習されたモデルは、一般化誤差が低く、adversarial 耐性が向上しており、表現品質の向上を示している。
  • 行列ベースのリーマンエントロピー関数は微分可能であり、エンドツーエンド学習に適しており、直接IB最適化を可能にした。
  • 驚くべきことに、同じ設定下でVIBはCIFAR-10で性能向上を示さなかったが、DIBは顕著な向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。