Skip to main content
QUICK REVIEW

[論文レビュー] Efficient and Robust Reinforcement Learning with Uncertainty-based Value Expansion

Bo Zhou, Hongsheng Zeng|arXiv (Cornell University)|Dec 10, 2019
Reinforcement Learning in Robotics参考文献 35被引用数 6
ひとこと要約

本論文では、確率的ダイナミクスモデルのアンサンブルを用いて不確実性をモデル化し、動的信頼下限(CLB)を用いて過大評価を低減することで、モデルベース価値拡張を強化するリスク回避的価値拡張(RAVE)を提案する。RAVEは、不確実性を考慮したリスク回避的価値推定を実現し、サンプル効率とロバスト性を向上させ、特に困難な環境で最先端の性能を達成した。この手法は、NeurIPS 2019 'Learn to Move' チャレンジで2位の手法を144ポイント差で上回り、優勝を達成した。

ABSTRACT

By integrating dynamics models into model-free reinforcement learning (RL) methods, model-based value expansion (MVE) algorithms have shown a significant advantage in sample efficiency as well as value estimation. However, these methods suffer from higher function approximation errors than model-free methods in stochastic environments due to a lack of modeling the environmental randomness. As a result, their performance lags behind the best model-free algorithms in some challenging scenarios. In this paper, we propose a novel Hybrid-RL method that builds on MVE, namely the Risk Averse Value Expansion (RAVE). With imaginative rollouts generated by an ensemble of probabilistic dynamics models, we further introduce the aversion of risks by seeking the lower confidence bound of the estimation. Experiments on a range of challenging environments show that by modeling the uncertainty completely, RAVE substantially enhances the robustness of previous model-based methods, and yields state-of-the-art performance. With this technique, our solution gets the first place in NeurIPS 2019: Learn to Move.

研究の動機と目的

  • 確率的環境におけるモデルベース強化学習のロバスト性の低さと、高い関数近似誤差を改善すること。
  • モデルフリーおよびハイブリッド強化学習フレームワークに不確実性モデリングを統合することで、サンプル効率と価値推定の精度を向上させること。
  • リスク回避的信頼下限を用いることで、価値関数学習における過大評価バイアスを低減すること。
  • 価値推定における信頼下限のパラメータを動的に調整することで、探索と活用のバランスを取ること。
  • 特に困難で高リスクな強化学習環境、特にNeurIPS 2019 'Learn to Move' チャレンジにおいて最先端の性能を達成すること。

提案手法

  • RAVEは、環境遷移におけるアレアトリック不確実性とエピステミック不確実性を両方捉える確率的ダイナミクスモデルのアンサンブルを用いることで、モデルベース価値拡張(MVE)を拡張する。
  • アンサンブルの確率的モデルから想像的ロールアウトを生成し、将来のリターンおよび価値関数を予測する。
  • 予測された価値分布にα-信頼下限(α-CLB)を適用し、過大評価を避けるために保守的でリスク回避的な価値推定を促進する。
  • αパラメータは学習中に動的に調整され、リスク回避性と探索のバランスを取ることで、学習の安定性と収束性を向上させる。
  • 価値関数のターゲットは、アンサンブル予測の信頼下限として計算され、分散を低減し、一般化性能を向上させる。
  • 推論時には、訓練済みのポリシーのみを用いるため、計算コストは低く抑えられ、ベースライン手法と比較して訓練時間はわずかに増加する。

実験結果

リサーチクエスチョン

  • RQ1環境ダイナミクスにおけるアレアトリック不確実性とエピステミック不確実性の両方をモデリングすることで、確率的環境におけるモデルベース価値拡張のロバスト性が向上するか?
  • RQ2価値予測に対する信頼下限を用いることで、高リスクな強化学習タスクにおける過大評価が低減され、ポリシー性能が向上するか?
  • RQ3信頼下限パラメータαの動的調整は、学習の安定性とサンプル効率にどのように影響するか?
  • RQ4モデルベースのロールアウトとリスク回避的価値推定を組み合わせたハイブリッド強化学習手法は、最先端のモデルフリーおよびハイブリッドベースラインを上回る性能を発揮するか?
  • RQ5不確実性を考慮した価値推定は、'Learn to Move' チャレンジのような現実世界の高リスク制御タスクにおいて、どれほど性能向上に寄与するか?

主な発見

  • RAVEはNeurIPS 2019 'Learn to Move' チャレンジで1位を達成し、2位の手法を144ポイント差で上回った。
  • Hopper-v1環境では、DDPGおよびSTEVEと比較して、予測されたQ値と真値との整合性が著しく高く、過大評価も低減された。
  • 動的α-CLBを用いたRAVEのバージョンは、固定α設定と比較して収束が早く、より安定した性能を示し、探索とリスク回避のバランスを効果的に取った。
  • LearnToRun環境では、RAVEの落下率が1.3%にまで低下したのに対し、DDPGでは15%であったため、優れたロバスト性を示した。
  • RAVEの訓練コストはSTEVEと比較して24.29%増加したが、推論コストは標準的なモデルフリー手法と同一であった。
  • 確率的アンサンブルモデルの使用により、環境の確率的性質(アレアトリック)とモデルの不確実性(エピステミック)の両方を捉えることで、価値推定の精度が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。