Skip to main content
QUICK REVIEW

[論文レビュー] Regularized Behavior Value Estimation

Çaǧlar Gülçehre, Sergio Gómez Colmenarejo|arXiv (Cornell University)|Mar 17, 2021
Reinforcement Learning in Robotics参考文献 47被引用数 4
ひとこと要約

本稿では、ターゲット方策のQ関数最適化ではなく、トレーニング中に行動方策の価値を推定する、新しいオフライン強化学習手法である正則化行動価値推定(R-BVE)を提案する。これにより、過大評価誤差が低減される。データセット内で高い報酬を得る行動を優遇するランク付け正則化項を適用することで、R-BVEはRL Unplugged Atari、bsuite、DeepMind Labベンチマークで最先端の性能を達成し、サンプル効率が著しく向上し、外挿誤差が低減される。

ABSTRACT

Offline reinforcement learning restricts the learning process to rely only on logged-data without access to an environment. While this enables real-world applications, it also poses unique challenges. One important challenge is dealing with errors caused by the overestimation of values for state-action pairs not well-covered by the training data. Due to bootstrapping, these errors get amplified during training and can lead to divergence, thereby crippling learning. To overcome this challenge, we introduce Regularized Behavior Value Estimation (R-BVE). Unlike most approaches, which use policy improvement during training, R-BVE estimates the value of the behavior policy during training and only performs policy improvement at deployment time. Further, R-BVE uses a ranking regularisation term that favours actions in the dataset that lead to successful outcomes. We provide ample empirical evidence of R-BVE's effectiveness, including state-of-the-art performance on the RL Unplugged ATARI dataset. We also test R-BVE on new datasets, from bsuite and a challenging DeepMind Lab task, and show that R-BVE outperforms other state-of-the-art discrete control offline RL methods.

研究の動機と目的

  • オフライン強化学習における分布外の状態-行動ペアに対するQ値の過大評価を是正すること。これにより方策の乖離が生じる。
  • トレーニング中に段階的方策改善を回避し、方策改善をデプロイメント時への延期により外挿誤差を低減すること。
  • 報酬の得られる行動をデータセット内で優先することで、オフライン強化学習におけるサンプル効率とロバスト性を向上させること。
  • 分布シフトに対して感受性が低く、環境との相互作用が安全でない、あるいは不可能な実世界の応用分野でも信頼性が高くなる手法を開発すること。
  • 行動価値推定にランク付け正則化を組み合わせた手法が、多様な環境で既存のオフライン強化学習アルゴリズムを上回ることを実証的に示すこと。

提案手法

  • R-BVEはトレーニング中に行動方策のQ値 $ Q^{/pi_{\cal B}} $ を推定し、$ \max $-演算子を排除することで過大評価を防止する。
  • 方策改善はデプロイメント時でのみ1回実行され、外挿誤差のリスクが最小限に抑えられる。
  • 未観測の行動のQ値を押し下げ、報酬の高い軌道から得られる行動を優先するランク付け正則化項を導入する。
  • 正則化は、Q値とベースラインとの差に基づき、成功したエピソード内の行動が他の行動よりも高い順位になるよう促す $ \max $-マージン損失を用いる。
  • 正則化はトレーニング中に適用され、Q学習およびディープQネットワークと互換性を持つように設計されている。
  • フィルタリング関数を用いて、報酬の得られるエピソードからの遷移に対してのみ正則化を適用することで、劣悪な軌道への過学習のリスクを低減する。

実験結果

リサーチクエスチョン

  • RQ1トレーニング中に行動方策の価値を推定することで、オフライン強化学習における過大評価誤差を低減できるか?
  • RQ2デプロイメント時への方策改善の延期が、オフライン強化学習における安定性と性能を向上させるか?
  • RQ3データセット内で報酬の高い行動を優先するランク付け正則化項が、分布シフトの影響と過大評価の影響を低減できるか?
  • RQ4R-BVEは多様なベンチマーク環境で最先端のオフライン強化学習手法と比較してどうなるか?
  • RQ5R-BVEはオフライン強化学習において、どの程度サンプル効率を向上させ、外挿誤差を低減するか?

主な発見

  • R-BVEはRL Unplugged Atariベンチマークで最先端の性能を達成し、既存のオフライン強化学習手法を上回っている。
  • bsuiteおよびDeepMind Labの環境では、R-BVEは他の最先端の離散制御オフライン強化学習アルゴリズムを一貫して上回っている。
  • アブレーションスタディにより、外挿による過大評価誤差が桁違いに低減されていることが示された。
  • R-BVEはサンプル効率を著しく向上させ、限られたデータセット上でも収束が早く、最終的な性能が優れていることが実証結果で示された。
  • ランク付け正則化項は、未観測の行動のQ値を効果的に抑制し、デプロイメント時の劣悪なカバレッジの行動選択のリスクを最小限に抑える。
  • アブレーションスタディにより、行動価値推定とランク付け正則化の両方が最適な性能を達成するために不可欠であり、それぞれが独立してロバスト性と正確性に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。