Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty Estimation and Calibration with Finite-State Probabilistic RNNs

Cheng Wang, Carolin Lawrence|arXiv (Cornell University)|Nov 24, 2020
Fault Detection and Control Systems参考文献 55被引用数 7
ひとこと要約

本稿では、学習可能な温度パラメータを用いたGumbel-Softmaxトリックを用いて確率的状態遷移を行うことで、不確実性を推定する有限状態確率的RNN、ST-τを提案する。複数の推論パスをサンプリングすることにより、予測不確実性を定量化し、ベイジアンニューラルネットワークの複雑さを必要とせずに、良好にキャリブレートされた確率、より優れた分布外検出、強化学習における探索と活用のトレードオフの改善を可能にする。

ABSTRACT

Uncertainty quantification is crucial for building reliable and trustable machine learning systems. We propose to estimate uncertainty in recurrent neural networks (RNNs) via stochastic discrete state transitions over recurrent timesteps. The uncertainty of the model can be quantified by running a prediction several times, each time sampling from the recurrent state transition distribution, leading to potentially different results if the model is uncertain. Alongside uncertainty quantification, our proposed method offers several advantages in different settings. The proposed method can (1) learn deterministic and probabilistic automata from data, (2) learn well-calibrated models on real-world classification tasks, (3) improve the performance of out-of-distribution detection, and (4) control the exploration-exploitation trade-off in reinforcement learning.

研究の動機と目的

  • 標準RNNにおける確率のキャリブレーションが不十分である問題、特に分布外入力に対しての問題を解決すること。
  • ベイジアンニューラルネットワークの複雑さを回避するRNNにおける不確実性定量化の手法を提供すること。
  • 現実世界の分類および強化学習タスクにおける良好にキャリブレートされた予測と、不確実性を考慮した意思決定の向上を実現すること。
  • データから決定的および確率的オートマトンの両方の学習を可能にすること。
  • 部分的に観測可能な環境における探索と活用のトレードオフを、内部の不確実性モデリングによって制御すること。

提案手法

  • モデルはk個の学習可能な状態の有限集合を用い、各RNN時刻ステップでこれらの状態上の確率分布を計算する。
  • 次の状態はGumbel-Softmaxトリックを用いてサンプリングされ、勾配ベースの学習が可能になる微分可能サンプリングを実現する。
  • Gumbel-Softmaxの温度τは学習中に最適化され、不確実性の集中度を制御するエントロピー正則化項として機能する。
  • 予測不確実性は複数回の順方向伝搬を実行し、出力確率の平均と分散を計算することで推定される。
  • 最小限のアーキテクチャ変更で、分類、OOD検出、強化学習タスクにこの手法を適用可能である。
  • LSTMおよびヴァナイルRNNアーキテクチャの両方と互換性があり、グリーディおよび確率的アクション選択の両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンニューラルネットワークに依存せずに、有限状態確率的RNNが良好にキャリブレートされた不確実性推定を達成できるか?
  • RQ2学習された温度パラメータτが不確実性定量化およびモデルキャリブレーションに与える影響は何か?
  • RQ3ST-τは、標準RNNおよびドロップアウトベースの手法と比較して、分布外検出性能を向上させられるか?
  • RQ4確率的状態遷移機構は、部分的に観測可能な強化学習環境における探索を向上させられるか?
  • RQ5ST-τは順序データから決定的および確率的オートマトンを学習できるか?

主な発見

  • IMDBベースのOODタスクにおいて、ST-τはOOD検出で最先端の性能を達成し、O-AUPRおよびO-AUROCスコアがベースラインを上回った。
  • 訓練中に温度τを学習させることで、固定τ=1よりも顕著にOOD検出性能が向上し、特に状態数が少ない(k=2)場合に顕著であった。
  • 強化学習において、ST-τはLSTM、VD、BBBと比較して、より高い累積報酬と低いサンプル複雑性を達成した。特に確率的方策設定下で顕著であった。
  • 実世界の分類タスクにおいて、予測確率と実際の正答率の整合性が向上し、キャリブレーションが改善された。
  • ST-τは順序データから決定的および確率的オートマトンを効果的に学習でき、構造的シーケンス行動をモデル化できる能力を示した。
  • アブレーションスタディにより、k=2という少数の状態と学習可能なτがあれば、不確実性モデリングに十分であり、過学習を回避しながら性能を維持できることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。