Skip to main content
QUICK REVIEW

[論文レビュー] Pitfalls of In-Domain Uncertainty Estimation and Ensembling in Deep Learning

Arsenii Ashukha, Alexander Lyzhov|arXiv (Cornell University)|Feb 15, 2020
Adversarial Robustness in Machine Learning参考文献 53被引用数 111
ひとこと要約

本論文は画像分類におけるドメイン内不確実性推定を分析し、一般的な指標の落とし穴を指摘し、深層アンサンブルの等価を表す DEE スコアを導入してアンサンブリング手法を比較し、深層アンサンブルがしばしば他よりも優れており、テスト時データ拡張が性能を大幅に向上させる可能性があることを示す。

ABSTRACT

Uncertainty estimation and ensembling methods go hand-in-hand. Uncertainty estimation is one of the main benchmarks for assessment of ensembling performance. At the same time, deep learning ensembles have provided state-of-the-art results in uncertainty estimation. In this work, we focus on in-domain uncertainty for image classification. We explore the standards for its quantification and point out pitfalls of existing metrics. Avoiding these pitfalls, we perform a broad study of different ensembling techniques. To provide more insight in this study, we introduce the deep ensemble equivalent score (DEE) and show that many sophisticated ensembling techniques are equivalent to an ensemble of only few independently trained networks in terms of test performance.

研究の動機と目的

  • DNN のドメイン内不確実性指標の信頼性と比較可能性を評価する。
  • 標準的な画像分類ベンチマークで広範なアンサンブリング手法を評価する。
  • 較正された対数尤度と DEE スコアを導入し、データセットを横断してアンサンブルを公正に比較する。
  • 不確実性推定と較正に及ぼすテスト時データ拡張の影響を調査する。

提案手法

  • 一般的なドメイン内不確実性指標(LL、Brier score、較正指標)を調査し、その落とし穴を明らかにする。
  • 最適温度で評価することにより、較正された対数尤度を公正な指標として提案する。
  • 深層アンサンブル等価(DEE)スコアを定義・計算し、アンサンブル手法を深層アンサンブルと比較できるようにする。
  • CIFAR-10/100 および ImageNet を対象に、深層アンサンブル、SSE、FGE、SWAG、VI、K-FAC Laplace、ドロップアウト、TTA を含むアンサンブル技法の一連を評価する。
  • 基準としてのテスト時データ拡張(TTA)を分析し、較正および温度スケーリングとの相互作用を検討する。
  • VGG16、PreResNet、WideResNet、ResNet50 などのアーキテクチャにわたり、較正された対数尤度と DEE を用いて性能を定量化する。

実験結果

リサーチクエスチョン

  • RQ1異なるモデルを比較する際、標準的なドメイン内不確実性指標の限界は何か。
  • RQ2ドメイン内データに対する予測性能と較正の面で、さまざまなアンサンブリング技法はどう比較されるか。
  • RQ3統一的で解釈可能な指標(DEE)は、データセットやアーキテクチャを跨いでアンサンブリング手法を公正にランク付けできるか。
  • RQ4ドメイン内不確実性推定と較正を改善する上でのテスト時データ拡張の役割は何か。

主な発見

  • 多くの一般的なドメイン内不確実性指標(対数尤度、Brier score、較正指標)はモデル間で信頼性の高い比較ができず、手法の誤順位を招くことがある。
  • 最適な温度で評価した較正された対数尤度は、ドメイン内不確実性のより安定で比較可能な指標を提供する。
  • 深層アンサンブル等価(DEE)スコアは、深層アンサンブルと同等のサイズでアンサンブル手法を比較できるようにする。与えられたテスト時予算で、深層アンサンブルはしばしば他の手法を上回る。
  • テスト時データ拡張(TTA)は、特に ImageNet においてアンサンブル性能を著しく向上させ、最小コストでより大きなアンサンブルに匹敵する可能性がある。
  • 複数の損失景観モードを探索する手法(深層アンサンブル、スナップショット・アンサンブル、循環SGLD)は、DEEの観点で CIFAR および ImageNet ではドロップアウト、VI、K-FAC Laplace のような単一モード手法よりも優れている。TTA は適切な温度スケーリングとともに較正と精度をさらに高める。
  • SSE および cSGLD は loss-landscape のモードを効果的に探索するが、その効果はハイパーパラメータとデータセット次第である。DEE は飽和やアンダーフィットが発生しているかを診断するのに役立つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。