Skip to main content
QUICK REVIEW

[論文レビュー] Disentangling Epistemic and Aleatoric Uncertainty in Reinforcement Learning

Bertrand Charpentier, Ransalu Senanayake|arXiv (Cornell University)|Jun 3, 2022
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本稿では、モデルフリー強化学習におけるアルエアトリック不確実性とエピステミック不確実性を分離するフレームワークを提案する。教師あり学習の不確実性推定手法(モンテカルロドロップアウト、アンサンブル、ディープカーネル学習、証拠ネットワーク)をDeep Q-Networksに適応することで、訓練中のサンプル効率の向上、摂動を加えたテスト環境への一般化性能の向上、OOD検出性能の向上を実現。CartPole、Acrobot、LunarLanderの環境において、定性的な実証的評価を通じて、vanilla DQNに比べて一貫した性能向上を示した。

ABSTRACT

Characterizing aleatoric and epistemic uncertainty on the predicted rewards can help in building reliable reinforcement learning (RL) systems. Aleatoric uncertainty results from the irreducible environment stochasticity leading to inherently risky states and actions. Epistemic uncertainty results from the limited information accumulated during learning to make informed decisions. Characterizing aleatoric and epistemic uncertainty can be used to speed up learning in a training environment, improve generalization to similar testing environments, and flag unfamiliar behavior in anomalous testing environments. In this work, we introduce a framework for disentangling aleatoric and epistemic uncertainty in RL. (1) We first define four desiderata that capture the desired behavior for aleatoric and epistemic uncertainty estimation in RL at both training and testing time. (2) We then present four RL models inspired by supervised learning (i.e. Monte Carlo dropout, ensemble, deep kernel learning models, and evidential networks) to instantiate aleatoric and epistemic uncertainty. Finally, (3) we propose a practical evaluation method to evaluate uncertainty estimation in model-free RL based on detection of out-of-distribution environments and generalization to perturbed environments. We present theoretical and experimental evidence to validate that carefully equipping model-free RL agents with supervised learning uncertainty methods can fulfill our desiderata.

研究の動機と目的

  • 実世界の応用において信頼性の高い不確実性対応型強化学習エージェントの必要性に対応すること。
  • 訓練時およびテスト時に、サンプル効率、一般化性能、OOD検出性能のバランスを取る4つの望ましい性質(desiderata)を定義すること。
  • 従来の教師あり学習の不確実性推定手法(MCドロップアウト、アンサンブル、ディープカーネル学習、証拠ネットワーク)を、最小限のアーキテクチャ変更でモデルフリー強化学習に適応すること。
  • OOD検出とドメインシフト一般化に基づく実用的な評価プロトコルを提案し、強化学習における不確実性推定の妥当性を検証すること。
  • 分離された不確実性推定が、標準的な制御環境における学習効率とロバストネスの両方を向上させることを示すこと。

提案手法

  • 強化学習における不確実性推定のための4つの望ましい性質を定義する:高いアルエアトリック不確実性下でのサンプル効率、高いエピステミック不確実性下での一般化性能、強力なOOD検出性能。
  • モンテカルロドロップアウト、アンサンブル、ディープカーネル学習、証拠ネットワークの4つの不確実性推定技術をDeep Q-Networksに統合し、アルエアトリック不確実性とエピステミック不確実性の両方を推定する。
  • 推論時におけるサンプリング戦略を用いる:アルエアトリック不確実性の推定には「サンプリング-アルエアトリック」、エピステミック不確実性の推定には「サンプリング-エピステミック」を用い、探索と意思決定を支援する。
  • エピステミック不確実性に基づく行動選択を用いた不確実性対応型探索を導入し、エpsilon-greedy法を拡張することで、未到達領域での探索を促進する。
  • OOD検出のAUC-PRと摂動を加えた環境への一般化性能を用いて、不確実性推定の性能を評価する。ドメインシフトを模倣する。
  • バッチ正規化とハイパーパramータチューニングを用いて、訓練の安定化と全手法における不確実性のキャリブレーション向上を図る。

実験結果

リサーチクエスチョン

  • RQ1アルエアトリック不確実性とエピステミック不確実性の分離推定は、DQN訓練中のサンプル効率を向上させ得るか?
  • RQ2不確実性対応型DQNエージェントは、vanilla DQNに比べて摂動を加えたテスト環境への一般化性能が優れているか?
  • RQ3教師あり学習から適応された不確実性推定手法は、強化学習環境でも信頼性のあるOOD検出性能を維持するか?
  • RQ4ドロップアウト、アンサンブル、DKL、証拠ネットワークなどの異なる不確実性推定手法は、強化学習における不確実性キャリブレーションと性能の観点でどのように比較されるか?
  • RQ5不確実性の分離は、未知または異常な環境における信頼性の高い行動をどの程度サポートするか?

主な発見

  • 不確実性対応型DQNエージェントは、CartPole環境においてvanilla DQNに比べて顕著に高いサンプル効率を達成し、訓練中のエピソード失敗数を削減した。
  • LunarLander環境では、不確実性対応モデルがより安定的かつ高い一般化性能を示し、特に「サンプリング-エピステミック」戦略を用いた場合に顕著だった。
  • 4つの不確実性手法(MCドロップアウト、アンサンブル、DKL、PostNet)は、すべてvanilla DQNを上回るOOD検出性能を示し、AUC-PRスコアから強力な異常検出能力を示した。
  • 「サンプリング-エピステミック」戦略は一貫して一般化性能とOOD検出性能を向上させ、エピステミック不確実性が未到達状態での探索に強力なシグナルである可能性を示唆した。
  • ハイパーパramータの研究から、MCドロップアウトにおけるサンプル数の増加はOOD検出性能をわずかに向上させたが、アンサンブルの性能はネットワーク数の変更に対して相対的に感度が低かった。
  • バッチ正規化は、特にディープカーネル学習と証拠ネットワークにおいて、潜在表現を誘導点やノーマライゼーションフローと一致させることで、全不確実性手法における安定性と性能を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。