Skip to main content
QUICK REVIEW

[論文レビュー] URSABench: Comprehensive Benchmarking of Approximate Bayesian Inference Methods for Deep Neural Networks

Meet P. Vadera, Adam D. Cobb|arXiv (Cornell University)|Jul 8, 2020
Gaussian Processes and Bayesian Inference被引用数 6
ひとこと要約

URSABench は、深層ニューラルネットワークにおける近似ベイジアン推論手法の評価を目的としたオープンソースのベンチマークフレームワークであり、不確実性の定量化、耐性、スケーラビリティ、正確性に焦点を当てている。CIFAR-10、CIFAR-100、OOD データセット上で SGLD、SGHMC、SWAG、MCドロップアウトなどの手法を評価し、cSGLD および cSGHMC がわずかな正確性の低下で優れた不確実性のキャリブレーションと耐性を達成しているのに対し、SWAG および MCドロップアウト はキャリブレーションと意思決定コストのトレードオフを示していることがわかった。

ABSTRACT

While deep learning methods continue to improve in predictive accuracy on a wide range of application domains, significant issues remain with other aspects of their performance including their ability to quantify uncertainty and their robustness. Recent advances in approximate Bayesian inference hold significant promise for addressing these concerns, but the computational scalability of these methods can be problematic when applied to large-scale models. In this paper, we describe initial work on the development ofURSABench(the Uncertainty, Robustness, Scalability, and Accu-racy Benchmark), an open-source suite of bench-marking tools for comprehensive assessment of approximate Bayesian inference methods with a focus on deep learning-based classification tasks

研究の動機と目的

  • 深層学習における近似ベイジアン推論手法の包括的かつ標準化された評価の欠如に対処すること。
  • 不確実性の定量化、耐性、スケーラビリティ、予測正確性の観点から、複数の手法を統合的に評価するための共通フレームワークを構築すること。
  • 標準的なディープラーニングベンチマーク上で、ベイジアンディープラーニング手法の公平かつ再現可能な比較を可能にすること。
  • 不確実性と耐性が重要な実世界のデプロイメントにおいて、最も効果的な手法を特定する支援を研究コミュニティに提供すること。

提案手法

  • URSABench は、深層ニューラルネットワーク分類タスクにおけるベイジアン推論手法のベンチマークを実行する、PyTorch ベースのオープンソースフレームワークを実装している。
  • 一貫性のある評価を可能にするために、標準化されたデータセット(CIFAR-10、CIFAR-100、SVHN、STL-10)とモデルアーキテクチャ(例:WideResNet28x10)を含んでいる。
  • 複数の近似ベイジアン推論手法を評価している:SGLD、SGHMC、cSGLD、cSGHMC、SWAG、MCドロップアウト、および後方分布近似のための PCA + ESS(SI)。
  • 評価指標のスイートを適用している:正確性(↑)、ネガティブ・ログリクアリティ(↓)、期待キャリブレーション誤差(ECE)(↓)、ベイジアンサプライズ(BS)(↓)、意思決定コスト(↓)、OOD および誤分類検出のための AUROC および AUCPR。
  • モンテカルロサンプルとサーヴィェイランス後方分布近似を用いて、後方予測分布と不確実性の定量化を推定している。
  • 複数の指標とデータセットを通じて結果を報告することで、不確実性のキャリブレーション、耐性、計算効率の間のトレードオフを評価している。

実験結果

リサーチクエスチョン

  • RQ1標準ベンチマーク上で、深層ニューラルネットワークにおける近似ベイジアン推論手法の中で、どの手法が最も正確な不確実性推定を提供するか?
  • RQ2異なるベイジアン手法は、分布外(OOD)入力および誤分類されたサンプルを検出する能力でどのように比較されるか?
  • RQ3ベイジアンディープラーニング手法において、予測正確性、不確実性のキャリブレーション、計算コストの間のトレードオフはどのようなものか?
  • RQ4cSGLD や cSGHMC といった手法は、MCドロップアウト や SWAG といった標準ベースラインと比較して、耐性および意思決定の信頼性でどのように異なるか?
  • RQ5SWAG などのサーヴィェイランス後方分布手法や、SGLD などのサンプリングベースの手法は、大規模モデルへスケーリングする際、不確実性の質を維持できるか?

主な発見

  • CIFAR-10 において cSGLD は、96.7% の正確性と ECE 0.006 の優れた不確実性キャリブレーションを達成し、意思決定コストが 102.9 と低く、SGHMC や MCドロップアウト を上回った。
  • CIFAR-100 において cSGLD は 83.2% の正確性、ECE 0.033、意思決定コスト 179.3 を達成し、SWAG(71.0% の正確性、ECE 0.110)および MCドロップアウト より顕著に優れた性能を示した。
  • cSGLD は OOD 検出性能も優れており、SVHN では AUROC-モデル不確実性が 0.968、STL-10 では 0.846 を達成し、SWAG や MCドロップアウト を上回った。
  • SGHMC および SGLD は誤分類検出において優れた性能(AUCPR-モデル:0.439 および 0.435)を示したが、cSGHMC は不確実性のキャリブレーションが悪く、性能が劣った。
  • SWAG は不確実性キャリブレーションが著しく悪く(CIFAR-100 で ECE:0.110)、意思決定コストが 316.9 と高く、安全性が求められる応用分野では信頼性に欠けることが示された。
  • MCドロップアウト は不確実性推定で競争力を持っていたが、CIFAR-10 で意思決定コストが 149.0 と高く、cSGLD よりも OOD 検出性能が劣った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。