[論文レビュー] Deep Anti-Regularized Ensembles provide reliable out-of-distribution uncertainty quantification
本稿では、訓練ドメイン外の分布(OOD)における不確実性評価を向上させるため、トレーニング中に小さな重みをペナルティ化することで、訓練ドメイン外での出力分散を増加させる、Deep Anti-Regularized Ensembles(DARE)を提案する。同時に、動的損失制御により、分布内精度を維持する。DAREはOODデータやハイパーパramータチューニングを必要とせず、最先端のOOD検出性能を達成する。
We consider the problem of uncertainty quantification in high dimensional regression and classification for which deep ensemble have proven to be promising methods. Recent observations have shown that deep ensemble often return overconfident estimates outside the training domain, which is a major limitation because shifted distributions are often encountered in real-life scenarios. The principal challenge for this problem is to solve the trade-off between increasing the diversity of the ensemble outputs and making accurate in-distribution predictions. In this work, we show that an ensemble of networks with large weights fitting the training data are likely to meet these two objectives. We derive a simple and practical approach to produce such ensembles, based on an original anti-regularization term penalizing small weights and a control process of the weight increase which maintains the in-distribution loss under an acceptable threshold. The developed approach does not require any out-of-distribution training data neither any trade-off hyper-parameter calibration. We derive a theoretical framework for this approach and show that the proposed optimization can be seen as a "water-filling" problem. Several experiments in both regression and classification settings highlight that Deep Anti-Regularized Ensembles (DARE) significantly improve uncertainty quantification outside the training domain in comparison to recent deep ensembles and out-of-distribution detection methods. All the conducted experiments are reproducible and the source code is available at \url{https://github.com/antoinedemathelin/DARE}.
研究の動機と目的
- ディープアンサンブルが分布外(OOD)データに対して過信した予測を出すという、顕著な限界を是正すること。
- OOD領域におけるアンサンブルの多様性を高めつつ、分布内予測の正確性を損なわないようにすること。
- OODトレーニングデータや複雑なハイパーパramータキャリブレーションに依存せずに、不確実性評価を向上させる手法を開発すること。
- 現実世界のディープラーニング導入において、信頼性の高い不確実性推定を可能にする理論的裏付けと実用性を兼ね備えたアプローチを提供すること。
提案手法
- トレーニング中に小さな重みをペナルティ化する反正則化項を導入し、大きな重みを持つネットワークを促進する。
- 訓練損失がしきい値を超えたまま継続する場合にのみ重み増加を活性化する動的制御プロセスを採用し、分布内精度の維持を保証する。
- 最適化を「ウォーター・フィリング」問題として理論的に定式化し、重みの大きさと一般化性能のバランスをフレームワーク化する。
- 区分線形活性化関数を用いた全結合ネットワークにこの手法を適用し、最終層をDAREヘッドに置き換えることで、残差ネットワークへの拡張を実現する。
- 平均二乗誤差損失とソフトマックスではなくログティスに基づく不確実性スコアを用いることで、重みスケーリングが不確実性に与える影響を保持する。
- 追加のOODデータやバリデーションに基づくハイパーパramータチューニングを必要としない、シンプルでスケーラブルなトレーニングプロトコルを採用する。
実験結果
リサーチクエスチョン
- RQ1小さな重みに対する反正則化は、ディープアンサンブルにおける分布外不確実性評価を改善できるか?
- RQ2分布外領域におけるアンサンブルの多様性を高めつつ、分布内パフォーマンスを劣化させずに実現できるか?
- RQ3動的重み制御メカニズムは、訓練損失を維持しながら、大きな重みと高い出力分散を促進できるか?
- RQ4提案手法は、OODデータやハイパーパramータチューニングを一切使用せず、既存のディープアンサンブルおよびOOD検出手法を上回る性能を発揮できるか?
主な発見
- DAREはOOD不確実性評価を顕著に向上させ、カメラシフト実験では標準的なディープアンサンブルと比較して、分布外NLLを2.4点低減した。
- ウェザーシフト実験では、DAREが最良のECEスコアを達成し、OODデータに対する優れたキャリブレーション性能を示した。
- CIFAR10でFashion-MNISTをOODとして用いた場合、DAREはベースラインのディープアンサンブルと比較してAUROCを34ポイント向上させたが、分布内精度はわずか2ポイント低下した。
- Fashion-MNISTでSVHNをOODとして用いた場合、DAREはベースラインより8ポイントのAUROC向上を達成し、強力な分布内パフォーマンスを維持した。
- 最終層をDARE最適化された全結合ヘッドに置き換えることで、ResNet32バックボーンへの適用に対しても、本手法は有効であることが実験で確認された。
- 実験では、λ=0(反正則化なし)の場合、重みの増加が最小限に抑えられ、λ=1に設定すると損失が爆発することが確認され、動的制御機構の必要性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。