Skip to main content
QUICK REVIEW

[論文レビュー] A New Family of Generalization Bounds Using Samplewise Evaluated CMI

Fredrik Hellström, Giuseppe Durisi|arXiv (Cornell University)|Oct 12, 2022
Distributed Sensor Networks and Detection Algorithms被引用数 5
ひとこと要約

本稿では、仮説ではなく損失の間の依存性を測る、サンプルごとに評価される条件付き相互情報量(e-CMI)に基づく、情報理論的一般化境界の新規族を提案する。訓練損失と母集団損失の jointly 凸関数を活用することで、特に二値KLに基づく境界が、よりタイトで安定した境界をもたらし、MNISTおよびCIFAR10データセットにおける深層ニューラルネットワークの一般化を、先行手法を上回る性能で特徴づける。

ABSTRACT

We present a new family of information-theoretic generalization bounds, in which the training loss and the population loss are compared through a jointly convex function. This function is upper-bounded in terms of the disintegrated, samplewise, evaluated conditional mutual information (CMI), an information measure that depends on the losses incurred by the selected hypothesis, rather than on the hypothesis itself, as is common in probably approximately correct (PAC)-Bayesian results. We demonstrate the generality of this framework by recovering and extending previously known information-theoretic bounds. Furthermore, using the evaluated CMI, we derive a samplewise, average version of Seeger's PAC-Bayesian bound, where the convex function is the binary KL divergence. In some scenarios, this novel bound results in a tighter characterization of the population loss of deep neural networks than previous bounds. Finally, we derive high-probability versions of some of these average bounds. We demonstrate the unifying nature of the evaluated CMI bounds by using them to recover average and high-probability generalization bounds for multiclass classification with finite Natarajan dimension.

研究の動機と目的

  • 仮説ではなく損失に依存する、サンプルごとに評価される条件付き相互情報量(e-CMI)を用いた、一般化境界の統一的フレームワークの構築を目的とする。
  • 仮説に基づく情報測度を損失に基づくe-CMIに置き換えることで、よりタイトで安定した一般化境界を導出することを目的とする。
  • 凸関数を用いて、既存のPAC-Bayesian境界をe-CMI設定に拡張することを目的とし、二値KL発散度を含む。
  • 統計的信頼性の向上を目的として、平均e-CMI境界の高確率版を提供すること。
  • 有限のNatarajan次元を持つ多クラス分類に対して既知の境界を回復することで、e-CMIフレームワークの表現力の高さを示すこと。

提案手法

  • 訓練損失と母集団損失の jointly 凸関数を含む一般不等式を提案し、その上界として分解されたサンプルごとのe-CMIを提示する。
  • 主に3つの境界を導出する:平方根境界(定理1)、線形境界(定理3)、二値KL境界(定理4)、いずれもe-CMIに基づく。
  • 独立ではあるが同一分布でない確率変数に対する、新しい集中不等式を導入し、二値KL境界の導出に用いる。
  • 定理7を用いてフレームワークを拡張し、平均境界をほとんど確実な制御にまで拡張することで、高確率境界を生成する。
  • 複数の訓練データと仮説のサンプルを用いたプラグイン推定器を採用し、実際の境界計算に応用する。
  • 学習率、幅、深さのハイパーパrameterスイープを実施し、SGDおよびSGLDを用いて、バイナリ化MNISTおよびCIFAR10での境界の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1サンプルごとに評価されるe-CMIを用いた情報理論的一般化境界の統一的フレームワークを開発できるか?
  • RQ2仮説に基づく相互情報量を損失に基づくe-CMIに置き換えることで、深層ニューラルネットワークの一般化境界がよりタイトで安定するか?
  • RQ3PAC-Bayesian理論で知られるタイトな境界である二値KL発散度が、e-CMI設定に成功裏に拡張可能で、性能向上を達成できるか?
  • RQ4提案された境界は、SGLDや平方根境界といった既存の最先端境界と比較して、タイトさとテスト誤差との相関性において優れているか?
  • RQ5e-CMIフレームワークは、有限のNatarajan次元を持つ多クラス分類に対して、既知の高確率および平均境界を回復できるか?

主な発見

  • 二値KLに基づくe-CMI境界は、バイナリ化MNISTおよびCIFAR10の両データセットにおいて、平方根境界および線形境界よりも母集団損失の特徴づけがよりタイトである。
  • e-CMIに基づく境界は、訓練の進行に伴っても安定しており、仮説に基づく境界とは異なり、訓練の進行とともに増加する傾向にない。
  • 小規模なサンプルサイズ(n=75)では、境界とテスト誤差の相関が強く、最小および最大のテスト誤差を示すハイパーパrameter設定を正しく同定する。
  • 大規模なサンプルサイズ(n=4000)では、境界のばらつきが減少するが、全体的なトレンドはテスト誤差の挙動と一貫している。
  • 本フレームワークは、有限のNatarajan次元を持つ多クラス分類に対して、平均および高確率一般化境界を成功裏に回復し、その統合的パワーを示している。
  • 数値実験の結果、バイナリ化MNISTにおいて、特にテスト誤差が高い初期訓練エポックでは、二値KL境界がSGLD境界を上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。