Skip to main content
QUICK REVIEW

[論文レビュー] Learning PAC-Bayes Priors for Probabilistic Neural Networks

María Pérez‐Ortiz, Omar Rivasplata|arXiv (Cornell University)|Sep 21, 2021
Adversarial Robustness in Machine Learning参考文献 26被引用数 7
ひとこと要約

この論文は、一般化境界と分類器性能の向上を目的として、確率的ニューラルネットワークにおけるデータに依存するPAC-Bayes事前分布の学習を調査する。さまざまな目的関数(ベイジアンにインspiredされたものやデータ拡張手法を含む)を用いて、データのサブセット上で事前分布を学習することで、最適化された事前分布が6つのデータセットにおいて、過パラメータ化されたモデルでさえ一貫してタイトなリスク証明をもたらすことを示している。これは自己証明学習の前進をもたらす。

ABSTRACT

Recent works have investigated deep learning models trained by optimising PAC-Bayes bounds, with priors that are learnt on subsets of the data. This combination has been shown to lead not only to accurate classifiers, but also to remarkably tight risk certificates, bearing promise towards self-certified learning (i.e. use all the data to learn a predictor and certify its quality). In this work, we empirically investigate the role of the prior. We experiment on 6 datasets with different strategies and amounts of data to learn data-dependent PAC-Bayes priors, and we compare them in terms of their effect on test performance of the learnt predictors and tightness of their risk certificate. We ask what is the optimal amount of data which should be allocated for building the prior and show that the optimum may be dataset dependent. We demonstrate that using a small percentage of the prior-building data for validation of the prior leads to promising results. We include a comparison of underparameterised and overparameterised models, along with an empirical study of different training objectives and regularisation strategies to learn the prior distribution.

研究の動機と目的

  • データに依存するPAC-Bayes事前分布の学習が、確率的ニューラルネットワークの性能および一般化保証に与える影響を調査すること。
  • 効果的な事前分布を学習するために必要なデータ量の最適値を特定し、データセット固有のトレードオフに焦点を当てる。
  • 異なる訓練目的および正則化戦略が、タイトなリスク証明をもたらす事前分布の学習に与える有効性を評価すること。
  • 過パラメータ化されたモデルが、学習済み事前分布を用いて強力な一般化保証を達成できるかどうかを評価すること。
  • データ拡張およびドロップアウトが、事前分布の学習および最終的なリスク証明のタイトさに与える役割を調査すること。

提案手法

  • 著者たちは、事前分布を訓練データのサブセットから学習することで、PAC-Bayes境界を最適化する確率的ニューラルネットワークを訓練し、事前分布が経験的リスク項とデータに独立していることを保証する。
  • 経験的リスク最小化(ERM)やベイジアンにインスパイアされた目的関数(例:BNNスタイルのELBO)など、事前分布学習のための複数の訓練目的を比較する。
  • 事後分布と事前分布の間のKLダイバージェンスを正則化項として用い、KLのトレードオフ係数のハイパーパramータスイープを伴う勾配ベースの最適化により、事前分布を最適化する。
  • リスク証明(一般化誤差の上界)とテストデータにおける確率的0-1誤差を評価し、事前分布をデータセットの異なるパcent(10%、25%、50%)で学習した結果を比較する。
  • 事前分布学習中に、mixup やドロップアウトなどのデータ拡張技術を適用し、一般化性能および事前分布の質の向上を図る。
  • 本手法は、MNIST や CIFAR-10、およびテーブルデータセットを含む6つの多様なデータセットで評価され、全結合ネットワークおよび畳み込みネットワークを用いて検証されている。

実験結果

リサーチクエスチョン

  • RQ1PAC-Bayes事前分布を学習するために割り当てる訓練データの最適割合は何か? これはデータセットによって異なるか?
  • RQ2事前分布学習のための異なる訓練目的が、リスク証明のタイトさとテスト精度に与える影響は何か?
  • RQ3データに依存する事前分布は、過パラメータ化されたニューラルネットワークにおける一般化境界を顕著に改善できるか?
  • RQ4事前分布学習中にデータ拡張を適用することで、よりタイトなリスク証明とより優れた分類器性能が達成できるか?
  • RQ5特に、情報に基づいた事前分布と情報のない事前分布の選択が、最適化プロセスおよび最終的なモデル性能に与える影響は何か?

主な発見

  • リスク証明のタイトさは、6つのすべてのデータセットで一貫して高く、本手法のデータおよびアーキテクチャの変動に対する頑健性を示している。
  • ベイジアンにインスパイアされた目的関数($f_{\texttt{bbb}}$)を用いて全事前分布を学習することで、ERMベースの事前分布よりもタイトなリスク証明と低い確率的0-1誤差が達成された。
  • 事前分布学習中にmixup正則化を適用することで、性能が著しく向上し、事前分布構築に10%のデータしか使用しなくても、50%のデータを用いたERMよりも優れた結果が得られた。
  • MNISTで25%の訓練データを使用した場合、mixupベースの事前分布学習により、リスク証明が0.041、確率的0-1誤差が0.025にまで低下し、50%データを用いたERMを上回った。
  • 50%のデータを使用した場合、ドロップアウトを事前分布学習に適用することで、リスク証明が0.026に低下し、誤差が0.020にまで減少した。
  • PAC-Bayes境界におけるKL項が境界値を支配しており、タイトな一般化保証を得るには適切に選ばれた事前分布が不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。