Skip to main content
QUICK REVIEW

[論文レビュー] Mean-Field Approximation to Gaussian-Softmax Integral with Application to Uncertainty Estimation

Zhiyun Lu, Eugene Ie|arXiv (Cornell University)|Jun 13, 2020
Adversarial Robustness in Machine Learning参考文献 42被引用数 5
ひとこと要約

本論文は、ガウス重み付きソフトマックス出力の積分を平均場近似によって近似する単一モデルの不確実性推定手法を提案する。これにより、複数のモデルを訓練する必要なくアンサンブルに類似した性能が得られる。本手法は、モデル重みの一次モーメントと二次モーメントを活用することで、不確実性の定量化および分布外検出において優れた結果を達成し、温度スケーリングやドロップアウトなどの手法を上回りつつ、ディープアンサンブルの計算コストを回避する。

ABSTRACT

Many methods have been proposed to quantify the predictive uncertainty associated with the outputs of deep neural networks. Among them, ensemble methods often lead to state-of-the-art results, though they require modifications to the training procedures and are computationally costly for both training and inference. In this paper, we propose a new single-model based approach. The main idea is inspired by the observation that we can "simulate" an ensemble of models by drawing from a Gaussian distribution, with a form similar to those from the asymptotic normality theory, infinitesimal Jackknife, Laplacian approximation to Bayesian neural networks, and trajectories in stochastic gradient descents. However, instead of using each model in the "ensemble" to predict and then aggregating their predictions, we integrate the Gaussian distribution and the softmax outputs of the neural networks. We use a mean-field approximation formula to compute this analytically intractable integral. The proposed approach has several appealing properties: it functions as an ensemble without requiring multiple models, and it enables closed-form approximate inference using only the first and second moments of the Gaussian. Empirically, the proposed approach performs competitively when compared to state-of-the-art methods, including deep ensembles, temperature scaling, dropout and Bayesian NNs, on standard uncertainty estimation tasks. It also outperforms many methods on out-of-distribution detection.

研究の動機と目的

  • ディープアンサンブル手法の計算コストを抑えた代替手法として、深層ニューラルネットワークにおける不確実性推定を効率的に行うことを目的とする。
  • 複数のモデルを保存・評価する必要がなくなるように、モデル重みの一次モーメントと二次モーメントのみを用いて閉形式近似推論を可能にする。
  • 漸近正規性、無限小ジャックナイフ、ラプラス近似といった既存の統計的枠組みと接続することで、理論的裏付けを提供する。
  • 訓練コストや推論コストを増加させることなく、不確実性の定量化および分布外検出で最先端または競争力のある性能を達成すること。

提案手法

  • 本手法は、ニューラルネットワーク重みの不確実性を多変量ガウス分布としてモデル化し、この分布上の期待ソフトマックス出力を近似する。
  • 不確実性の積分が解析的に計算できないため、ガウス重み付きソフトマックス出力の積分を平均場ガウス・ソフトマックス(mfGS)近似により解析的に計算する。
  • 近似には重み分布の一次モーメント(平均)と二次モーメント(共分散)のみを用い、モンテカルロサンプルや複数モデルの保存を回避して閉形式推論を実現する。
  • 重みの不確実性から学習可能な、データ依存の適応的温度を導入することで、グローバル温度スケーリングを一般化する。
  • 漸近正規性、無限小ジャックナイフ、ラプラス近似、およびトレーニング軌道のサンプリングに基づき、ガウス分布の動機づけを提供する。
  • モンテカルロサンプルを避けることで、標準的なアンサンブルやベイジアン推論と比較して著しく計算コストを削減する。

実験結果

リサーチクエスチョン

  • RQ1複数のネットワークを訓練せずに、1つのディープニューラルネットワークがアンサンブルモデルの予測不確実性を近似できるか?
  • RQ2重み分布の一次モーメントと二次モーメントのみを用いて、ガウス重み付きソフトマックス出力の積分を解析的に近似できるか?
  • RQ3提案手法の平均場ガウス・ソフトマックス近似は、標準ベンチマークにおいて既存の単一モデル不確実性推定手法を上回るか?
  • RQ4最先端のアプローチと比較して、分布外検出においてどの程度一般化性能を発揮するか?
  • RQ5ジャックナイフ、ラプラス近似、漸近正規性への理論的接続を実用的な不確実性推定の向上に活かせるか?

主な発見

  • 提案手法であるmfGSは、標準的な不確実性推定ベンチマークで競争力のある性能を達成し、ディープアンサンブルやベイジアンニューラルネットワークと同等またはそれを上回る。
  • 温度スケーリング、ドロップアウト、その他の単一モデルベースラインと比較して、不確実性のキャリブレーションおよび分布外検出の両タスクで優れた性能を示す。
  • 重み分布の一次モーメントと二次モーメントのみを用いることで、モンテカルロサンプルや複数モデルの保存を必要とせず、閉形式推論が可能となる。
  • 訓練や推論コストを標準モデル訓練に追加で増加させることなく、ディープアンサンブルとは異なり計算が効率的である。
  • 無限小ジャックナイフおよびラプラス近似への理論的接続が、本手法の設計と性能に合理的な根拠を提供する。
  • 実験的結果は、無限大のアンサンブルモデルが閉形式ガウス分布を介して効果的にシミュレート可能であるという仮説を裏付ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。