Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning using the Variational Predictive Information Bottleneck with a Validation Set

Sayandev Mukherjee|arXiv (Cornell University)|Nov 6, 2019
Statistical Mechanics and Entropy参考文献 3被引用数 4
ひとこと要約

この論文は、予測情報ボトルネックフレームワークを、検証データセットを含む機械学習に拡張する。モデルの訓練を、将来のデータに対する予測力、訓練データの圧縮、検証データセットの性能のバランスを取る情報処理最適化問題として定式化する。主な貢献は、訓練データ、検証データ、将来のデータを統合する共同情報ボトルネック基準を用いた変分推論目的関数であり、最適化が成功した場合、ベイズ的更新則に類似した更新則が得られる。

ABSTRACT

Zellner (1988) modeled statistical inference in terms of information processing and postulated the Information Conservation Principle (ICP) between the input and output of the information processing block, showing that this yielded Bayesian inference as the optimum information processing rule. Recently, Alemi (2019) reviewed Zellner's work in the context of machine learning and showed that the ICP could be seen as a special case of a more general optimum information processing criterion, namely the Predictive Information Bottleneck Objective. However, Alemi modeled the model training step in machine learning as using training and test data sets only, and did not account for the use of a validation data set during training. The present note is an attempt to extend Alemi's information processing formulation of machine learning, and the predictive information bottleneck objective for model training, to the widely-used scenario where training utilizes not only a training but also a validation data set.

研究の動機と目的

  • 実際の応用で一般的に使われるが、先行する情報理論的定式化には欠落していた検証データセットを含む機械学習における予測情報ボトルネックフレームワークの拡張を目的とする。
  • モデルの訓練を、モデルパラメータと将来のデータの間の相互情報量を最大化し、同時に訓練データおよび検証データからの情報量を制約する情報処理タスクとして形式化することを目的とする。
  • 過去のデータ、検証データ、将来のデータを含む共同情報ボトルネック目的関数の妥当な最適化を可能にする変分近似を導出することを目的とする。
  • 新しい目的関数に基づく最適化が成功した場合、訓練データ、検証データ、将来のデータを統合したベイズ的更新則が得られることを示すこと

提案手法

  • 訓練データおよび検証データからの情報量をラグランジュ乗数を用いて制約する一方で、モデルパラメータと将来のデータの間の相互情報量を最大化する共同情報ボトルネック目的関数を提案する。
  • マークフ・性質と情報理論的恒等式を用いて、等価な制約なし最適化問題に変換し、条件付き相互情報量の重み付き和の最小化に帰着させる。
  • 訓練データおよび検証データの尤度に対する2つの変分近似を適用し、パラメータの事後分布の最適化を実行可能にする。
  • 温度に類似したハイパーパrameter β と γ を用いて、事前分布、訓練尤度、検証尤度を組み合わせたモデルパラメータのための変分分布を導入する。
  • 最適な変分事後分布を、事前分布、訓練尤度の β 乗、検証尤度の γ 乗の正規化積として導出する。ここで、正規化定数は Zβ,γ と表される。
  • 訓練データおよび検証データに関する情報制約が満たされた場合、最適な更新則は訓練データおよび検証データの結合尤度を用いたベイズ推論に簡略化される。

実験結果

リサーチクエスチョン

  • RQ1予測情報ボトルネックフレームワークは、機械学習の訓練において検証データセットをどのように統合できるか?
  • RQ2将来のデータの予測性能と訓練データおよび検証データの圧縮をバランス取る情報理論的目的関数は何か?
  • RQ3検証データセットの統合は、モデル事後分布の変分近似および最適化にどのように影響を与えるか?
  • RQ4提案された目的関数がいつベイズ推論に簡略化されるか?
  • RQ5ハイパーパrameter β と γ は、訓練データ、検証データ、将来のデータの情報量のトレードオフをどのように制御するか?

主な発見

  • 提案された目的関数は、真のデータ分布とモデルパラメータの変分事後分布に依存する変分目的関数によって上界で抑えられる。
  • 最適な変分事後分布は、事前分布、訓練尤度の β 乗、検証尤度の γ 乗の正規化積として導出され、正規化定数 Zβ,γ を持つ。
  • 訓練データおよび検証データに関する情報制約が満たされた場合(I(θ; xP) > I′0 および I(θ; xV|xP) > I′′0)、最適な更新則は訓練データおよび検証データの結合尤度を用いたベイズ推論に簡略化される。
  • 本手法は、検証データセットの使用に情報処理の観点から原理的かつ整合的な情報理論的基盤を提供する。この実践的アプローチは、情報処理の観点から自然に導かれる。
  • 本フレームワークは、アレミの予測情報ボトルネックを検証データを含む形に一般化し、相互情報量の観点から訓練、検証、一般化を統一的に捉える視座を提供する。
  • 最適化が成功した場合、本手法はベイズ推論と整合性を保ち、検証データに基づくハイパーパrameterチューニングが最適な情報処理に一致することを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。