Skip to main content
QUICK REVIEW

[論文レビュー] Risk-Averse Bayes-Adaptive Reinforcement Learning

Marc Rigter, Bruno Lacerda|arXiv (Cornell University)|Feb 10, 2021
Reinforcement Learning in Robotics参考文献 51被引用数 6
ひとこと要約

本稿では、エピステミックおよびアレアトリックな不確実性を同時に扱うために、ベイズ的適応型MDP(BAMDP)における総報酬の条件付きリスク価値(CVaR)を最適化する、リスク回避型ベイズ的適応型モンテカルロ木探索(RA-BAMCP)を提案する。問題を2人対戦型の確率的ゲームとして定式化し、モンテカルロ木探索(MCTS)とベイズ最適化を組み合わせることで、ベッティングおよびナビゲーションの領域において、ベースラインと比較して優れたリスク回避性能を達成した。特に、悪くない報酬を得る可能性を低減した。

ABSTRACT

In this work, we address risk-averse Bayes-adaptive reinforcement learning. We pose the problem of optimising the conditional value at risk (CVaR) of the total return in Bayes-adaptive Markov decision processes (MDPs). We show that a policy optimising CVaR in this setting is risk-averse to both the parametric uncertainty due to the prior distribution over MDPs, and the internal uncertainty due to the inherent stochasticity of MDPs. We reformulate the problem as a two-player stochastic game and propose an approximate algorithm based on Monte Carlo tree search and Bayesian optimisation. Our experiments demonstrate that our approach significantly outperforms baseline approaches for this problem.

研究の動機と目的

  • エピステミックおよびアレアトリックな不確実性が共存するモデルベースのベイズ強化学習におけるリスク回避意思決定を扱う。
  • ベイズ的適応型MDP(BAMDP)における総報酬の条件付きリスク価値(CVaR)を最適化し、まれな高インパクトの悪影響に対して耐性を持つようにする。
  • 拡張状態空間と連続的アクション空間の指数的増加に対処できる効率的なアルゴリズムを開発する。
  • CVaRを用いたエピステミックおよびアレアトリックな不確実性の共同緩和が、期待値最大化やリスクに無関心な手法と比較して、より信頼性が高く安全な方策をもたらすことを示す。
  • 確率的ゲームの定式化とスケーラブルな近似推論を用いて、不確実な環境におけるリスク回避計画のための新フレームワークを確立する。

提案手法

  • 問題を、敵対的環境がエージェントのCVaRを最小化するように行動を選択する2人対戦型の確率的ゲームとして再定式化する。
  • モンテカルロ木探索(MCTS)を用いて、MDPの信念と環境状態を含む拡張状態空間を探索する。
  • 敵対的プレイヤーの連続的アクション空間において、有望なアクションを効率的に展開するためにベイズ最適化を採用する。
  • 各MCTSノードで事後分布の更新を実行し、木全体にわたり不確実性を伝搬するため、MDPの信念分布を維持する。
  • CVaRの目的関数は報酬分布上で計算され、リスク水準αが最も悪い結果に対する信頼水準を制御する。
  • ノードごとの事後分布計算が必要なため、ルートサンプリングを回避し、スケーラビリティに制限が生じるが、信念更新の正確性を保つ。

実験結果

リサーチクエスチョン

  • RQ1ベイズ的適応型MDPにおけるCVaR最適化は、エピステミックおよびアレアトリックな不確実性に起因する悪い結果のリスクを効果的に低減できるか?
  • RQ2リスク回避型方策(CVaRに基づく)は、期待値最大化やリスクに無関心なベースラインと比較して、不確実な環境下でどのように性能を発揮するか?
  • RQ3MCTSとベイズ最適化を組み合わせることで、高次元かつ不確実なMDPにおけるスケーラブルで効果的なCVaR最適化が可能になるか?
  • RQ4敵対的環境を含む提案された確率的ゲーム定式化は、標準的なベイズ強化学習手法と比較して、より頑健な方策をもたらすか?
  • RQ5CVaR指標におけるリスク水準αの選択は、アルゴリズムの性能にどの程度感度を示すか?

主な発見

  • ベッティングゲームのドメインでは、RA-BAMCPはα=0.03のときCVaRが23.51、α=0.2のとき18.91を達成し、特に低αにおける最悪報酬において、CVaR VI EMDPおよびCVaR BAMDP PGを顕著に上回った。
  • 自動車ナビゲーションのドメインでは、RA-BAMCPはα=0.03のときCVaRが25.41、α=0.2のとき27.76を達成し、期待値が妥当な水準を維持しながら、強いリスク回避性能を示した。
  • BAMCP(期待値最適化)は最高の期待報酬(50.16)を達成したが、分散が大きく、CVaRが低く、悪い結果のリスクが高いことが示された。
  • CVaR BAMDPポリシー勾配法はα=0.03のとき(CVaR=10.05)に著しく性能が低く、局所最適値に強く依存し、低信頼水準のリスク設定で不安定であった。
  • アブレーションスタディにより、同じ計算予算下で、行動展開にベイズ最適化を用いることが重要であることが確認され、ランダムな行動展開では著しく性能が低下した。
  • 報酬のヒストグラムでは、RA-BAMCPが報酬分布の左端(左尾部)を右側にシフトさせ、極端な負の結果の確率を低減していることが確認され、リスク回避性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。