Skip to main content
QUICK REVIEW

[論文レビュー] On Uncertainty, Tempering, and Data Augmentation in Bayesian Classification

Sanyam Kapoor, Wesley J. Maddox|arXiv (Cornell University)|Mar 30, 2022
Gaussian Processes and Bayesian Inference被引用数 9
ひとこと要約

この論文は、分類のためのベイジアンニューラルネットワークにおいて、ディリクレ観測モデルを用いて誤差的不確実性を明示的にモデル化することを提案する。これにより、事後分布の温度調整(tempering)の必要性が解消される。データ拡張が誤差的不確実性を効果的に増加させることを示し、T < 1 の冷たい事後分布(cold posteriors)が自然にこの増加を反映している。一方、ディリクレモデルは温度調整を経ずに、集中パラメータによる不確実性の直接制御によって、より優れた性能を達成する。

ABSTRACT

Aleatoric uncertainty captures the inherent randomness of the data, such as measurement noise. In Bayesian regression, we often use a Gaussian observation model, where we control the level of aleatoric uncertainty with a noise variance parameter. By contrast, for Bayesian classification we use a categorical distribution with no mechanism to represent our beliefs about aleatoric uncertainty. Our work shows that explicitly accounting for aleatoric uncertainty significantly improves the performance of Bayesian neural networks. We note that many standard benchmarks, such as CIFAR, have essentially no aleatoric uncertainty. Moreover, we show data augmentation in approximate inference has the effect of softening the likelihood, leading to underconfidence and profoundly misrepresenting our honest beliefs about aleatoric uncertainty. Accordingly, we find that a cold posterior, tempered by a power greater than one, often more honestly reflects our beliefs about aleatoric uncertainty than no tempering -- providing an explicit link between data augmentation and cold posteriors. We show that we can match or exceed the performance of posterior tempering by using a Dirichlet observation model, where we explicitly control the level of aleatoric uncertainty, without any need for tempering.

研究の動機と目的

  • ベイジアン分類において誤差的不確実性の明示的モデル化が不足している問題に対処する。標準的なソフトマックス尤度関数はラベルノイズやデータの不確実性を考慮しない。
  • データ拡張が近似的なベイジアン推論における誤差的不確実性の有効レベルに与える影響を調査する。
  • 冷たい事後分布効果(cold posterior effect)を、データ拡張とモデルの不適合(misspecification)によって生じる誤差的不確実性の誤表現の結果として説明する。
  • 誤差的不確実性を直接制御できるディリクレ観測モデルを提案し、事後分布の温度調整の必要性を排除する。
  • 適切な誤差的不確実性モデル化が、温度調整や標準尤度関数よりも優れた予測性能とより誠実な不確実性推定をもたらすことを実証する。

提案手法

  • ベイジアンニューラルネットワークにおける標準的なソフトマックス尤度を、クラス確率上のディリクレ分布として解釈することで、誤差的不確実性の明示的モデル化を可能にする。
  • 入力に依存する集中パラメータを持つノイズありディリクレモデルを導入し、入力ごとに不確実性を適応的に調整できるようにする。
  • データ拡張が尤度を緩和し、誤差的不確実性を効果的に増加させることを示し、冷たい事後分布効果の説明に寄与する。
  • T < 1 の事後分布の温度調整が、真のクラスのディリクレ分布の集中パラメータを増加させることに対応することを示し、より高い信頼性をモデル化していることを明らかにする。
  • CIFAR およびその他のベンチマークで、標準的なBNN、温度調整付き事後分布、および提案されたディリクレモデルの性能を実験的に評価する。
  • 近似的推論(例:変分推論)を用いたベイジアンニューラルネットワークを用い、予測精度と不確実性のキャリブレーションを評価する。

実験結果

リサーチクエスチョン

  • RQ1冷たい事後分布効果がベイジアンニューラルネットワークに持続する理由は何か?これはモデルの不適合の兆候であるか?
  • RQ2データ拡張はベイジアン分類における誤差的不確実性の有効レベルにどのように影響するか?
  • RQ3回帰におけるノイズ分散と同様に、分類において誤差的不確実性を明示的にモデル化できるか?
  • RQ4ディリクレ観測モデルは、ベイジアンニューラルネットワークにおける事後分布の温度調整の必要性を排除できるか?
  • RQ5誤差的不確実性の明示的モデル化は、予測性能と不確実性キャリブレーションをどのように向上させるか?

主な発見

  • データ拡張は、ベイジアンニューラルネットワークにおける有効な誤差的不確実性を増加させ、T < 1 の冷たい事後分布がT = 1よりも優れた性能を示す理由を説明する。
  • 冷たい事後分布効果は、標準尤度関数がデータ拡張によって引き起こされる誤差的不確実性の増加を正しく表現できないことによるものである。
  • 提案されたディリクレ観測モデルは、集中パラメータによる誤差的不確実性の直接制御を可能にし、温度調整を経ずに、温度調整付き事後分布と同等またはそれを上回る性能を達成する。
  • 適切に指定された誤差的不確実性モデルを備えたモデルは、事後分布の温度調整を必要とせず、温度調整がモデルの不適合の兆候であるが、必須の補正手段ではないことを示唆する。
  • データ拡張を行わないモデルでは冷たい事後分布効果が現れないのは、根本的なベイジアン推論の性質ではなく、モデルの不適合に起因するアーティファクトである。
  • 適切な誤差的不確実性モデル化は、分布シフト下でも、より誠実な不確実性推定と向上した予測精度をもたらす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。