Skip to main content
QUICK REVIEW

[論文レビュー] Adapting the Linearised Laplace Model Evidence for Modern Deep Learning

Javier Antorán, David M. Janz|UvA-DARE (University of Amsterdam)|Jun 17, 2022
Gaussian Processes and Bayesian Inference被引用数 5
ひとこと要約

本稿は、古典的な線形化ラプラス法と現代のディープラーニングの実践との間の重大な不適合性を特定する。特に確率的最適化と正規化層の利用に関して、2つの主要な改善策を提案する。1つ目は、線形化に元の学習点 θ̃ の代わりに線形化モデルの最適パラメータ θ⋆ を使用すること。2つ目は、正規化済みと非正規化パラメータのための別個の事前分布をモデル化すること。これらの変更により、ResNet やトランスフォーマー、オートエンコーダーを含む多様なアーキテクチャにおいて、モデルの証拠の推定と不確実性のキャリブレーションが著しく向上する。

ABSTRACT

The linearised Laplace method for estimating model uncertainty has received renewed attention in the Bayesian deep learning community. The method provides reliable error bars and admits a closed-form expression for the model evidence, allowing for scalable selection of model hyperparameters. In this work, we examine the assumptions behind this method, particularly in conjunction with model selection. We show that these interact poorly with some now-standard tools of deep learning--stochastic approximation methods and normalisation layers--and make recommendations for how to better adapt this classic method to the modern setting. We provide theoretical support for our recommendations and validate them empirically on MLPs, classic CNNs, residual networks with and without normalisation layers, generative autoencoders and transformers.

研究の動機と目的

  • 確率的最適化と正規化層を用いて訓練された現代のディープラーニングモデルに古典的線形化ラプラス法を適用した場合の性能の悪さを是正すること。
  • 標準的な線形化ラプラス法は学習点 θ̃ が損失の最小点であると仮定しているが、非収束学習の状況ではしばしば実際には成立しないことの特定。
  • バッチ正規化などの層を含むネットワークにおける予測分布が不適切に定義される問題を、正規化済みと非正規化パラメータのための別個の事前分布の導入により解決すること。
  • 線形化モデルの最適パラメータに基づく修正された目的関数を用いて、正確なモデル証拠推定を実現し、モデル選択を改善すること。
  • 提案手法が多様なアーキテクチャとデータセットにおいて、よりキャリブレートされた不確実性推定と高いテスト対数尤度を達成することを実証すること。

提案手法

  • 元の学習点 θ̃ を使用する標準的な線形化ラプラスモデル証拠を、線形化モデルの最適パラメータ θ⋆ を使用する新しい目的関数に置き換える。これは凸最適化問題を解くことで達成される。
  • 線形化モデルの損失の形状を考慮した修正されたモデル証拠の式を導出する。これにより、収束していない学習時においても真の事後分布とより整合性のある推定が可能になる。
  • 正規化済みと非正規化パラメータのための別個の事前分布をモデル化する二重事前分布の定式化を導入し、バッチ正規化などの層を含むネットワークにおける問題を解決する。
  • 新しいモデル証拠目的関数をハイパーパrameter選択に適用し、正則化パラメータのスケーラブルで微分可能かつ凸な最適化を可能にする。
  • ニューラルタングエント・カーネル(NTK)フレームワークを用いて線形化モデルを形式化し、提案手法の理論的性質を裏付ける。
  • MLP、CNN、ResNet(正規化あり・なし)、トランスフォーマー、オートエンコーダーの各モデルで、不確実性のキャリブレーションと予測性能を比較して、手法の実証的妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1なぜ古典的な線形化ラプラス法は、確率的最適化で訓練された現代のディープラーニングモデルに適用した場合、信頼性の低いモデル証拠推定をもたらすのか?
  • RQ2学習点 θ̃ が訓練損失の最小点でない場合に、線形化ラプラス法をどのように適合させれば、有効に保てるか?
  • RQ3なぜ線形化ラプラス法における予測分布が正規化層を含むネットワークで不適切に定義されるのか? そして、この問題はどのように是正できるか?
  • RQ4元の学習点 θ̃ の代わりに線形化モデルの最適パラメータ θ⋆ を使用することで、よりキャリブレートされた不確実性推定と向上したモデル証拠が得られるか?
  • RQ5提案手法は、多様なアーキテクチャとデータセットにおいて、標準的な線形化ラプラス法よりもテスト対数尤度と不確実性キャリブレーションの両面で優れているか?

主な発見

  • 線形化モデルの最適パラメータ θ⋆ を元の学習点 θ̃ の代わりに使用することで、収束していない状況でも、モデル証拠推定が著しく正確になる。
  • θ⋆ を用いたモデル証拠は、標準的手法(θ̃ を使用)に比べて一貫して高いテスト対数尤度を達成し、ResNet-50 を用いた CIFAR10 では最大 0.5 ユニットの向上を示した。
  • MNIST における ResNet-18 では、複数の層別正則化パラメータを用いた本手法が、単一の λ を使用した標準手法(0.520 ± 0.009)に比べ、テスト負対数尤度が 0.003 ± 0.000 まで低下した。
  • 正規化層向けの二重事前分布アプローチは、不適切に定義された予測分布の問題を効果的に解消し、バッチ正規化ネットワークにおける信頼性のある不確実性推定を可能にした。
  • 実証的結果から、本手法は不確実性のキャリブレーションがより良好であり、オートエンコーダーのタスクでは予測標準偏差が実際の再構成誤差とよく一致した。
  • 新しい目的関数(Mθ⋆)を用いたハイパーパrameter最適化は安定に収束したが、標準的手法(Mθ̃)では正則化パラメータが 0 に発散するなど、不安定性が生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。