Skip to main content
QUICK REVIEW

[論文レビュー] Offline Reinforcement Learning with Soft Behavior Regularization

Haoran Xu, Xianyuan Zhan|arXiv (Cornell University)|Oct 14, 2021
Reinforcement Learning in Robotics参考文献 59被引用数 9
ひとこと要約

本稿では、状態に依存する密度比を用いて行動正則化をソフト化する、Soft Behavior-regularized Actor Critic (SBAC) を提案する。この手法により、より優れた方策性能と安定性が達成される。行動方策のアドバンテージを状態訪問頻度比で重み付けすることで、性能向上が保証され、状態固有の正則化が可能となり、MuJoCo や Adroit ベンチマークで最先端性能を達成する。

ABSTRACT

Most prior approaches to offline reinforcement learning (RL) utilize extit{behavior regularization}, typically augmenting existing off-policy actor critic algorithms with a penalty measuring divergence between the policy and the offline data. However, these approaches lack guaranteed performance improvement over the behavior policy. In this work, we start from the performance difference between the learned policy and the behavior policy, we derive a new policy learning objective that can be used in the offline setting, which corresponds to the advantage function value of the behavior policy, multiplying by a state-marginal density ratio. We propose a practical way to compute the density ratio and demonstrate its equivalence to a state-dependent behavior regularization. Unlike state-independent regularization used in prior approaches, this extit{soft} regularization allows more freedom of policy deviation at high confidence states, leading to better performance and stability. We thus term our resulting algorithm Soft Behavior-regularized Actor Critic (SBAC). Our experimental results show that SBAC matches or outperforms the state-of-the-art on a set of continuous control locomotion and manipulation tasks.

研究の動機と目的

  • 既存のオフライン強化学習手法が硬い、状態に依存しない行動正則化を採用しているため、性能向上が保証されないという問題に対処すること。
  • オフライン設定でも適用可能な、行動方策に対する性能向上を保証する方策学習目的を構築すること。
  • 高い信頼度の状態ではより大きな方策の逸脱を許容できる、実用的で状態に依存する正則化メカニズムを導入すること。
  • マージナル状態訪問頻度比を活用することで、分布シフトを軽減し、評価時のロバスト性を向上させること。
  • 標準ベンチマークにおいて、従来の行動正則化オフライン強化学習アルゴリズムよりも強力でより安定した性能を達成すること。

提案手法

  • 割合割合の状態マージナル密度比を重みとして用いた、行動方策のアドバンテージに基づく新しい方策目的を導出。これにより、方策の保証された改善が可能となる。
  • オフラインデータを用いて状態訪問密度比を推定する実用的手法を提案。オンラインロールアウトの必要がなくなる。
  • 密度比を状態に依存する正則化項として再解釈。固定値またはエントロピーに基づくペナルティの代わりに使用。
  • 導出した目的関数をアクタ・クリティック学習に統合した、モデルフリーなアルゴリズムである Soft Behavior-regularized Actor Critic (SBAC) を導入。Q関数と方策の更新を含む。
  • 目的関数における $Q^{ u}$ の代わりに、行動方策の Q 値関数 $Q^{ u}$ をサーヴェイランスとして用いることで、学習の安定性を向上。
  • 状態の信頼度に応じて正則化強度を動的に調整する重み付き方策更新を採用。低カバレッジ状態ではより多くの探索を可能にする。

実験結果

リサーチクエスチョン

  • RQ1状態に依存する行動正則化スキームは、オフライン強化学習において行動方策に対する保証された性能向上をもたらすか?
  • RQ2マージナル状態訪問頻度比は、モデルフリーなオフライン強化学習設定において、どのように効果的に推定・利用できるか?
  • RQ3ソフトで状態に依存する正則化は、固定で状態に依存しない正則化よりも、最終的な性能と学習安定性において優れているか?
  • RQ4提案手法は、D4RL や Adroit といった困難な連続制御ベンチマークで最先端の性能を達成できるか?
  • RQ5分布シフトや分布外行動の処理において、既存の OPE や行動正則化手法と比較して、本手法はどのように性能を発揮するか?

主な発見

  • SBAC は D4RL ベンチマークにおける標準的な MuJoCo ロケモーションおよびマニピュレーションタスクで最先端の性能を達成した。
  • 特に複雑な制御設定において、SAC や TD3、BCQ などの先行手法と比較して、性能が優れているか、同等の性能を示した。
  • 複数のランダムシードにおいて、著しく低い分散とより安定した学習曲線を示しており、ロバスト性が裏付けられた。
  • アブレーションスタディでは、状態に依存する重み付け $w^{ u}(s)$ を削除すると、性能の低下と不安定性の増大が確認された。
  • SBAC は $Q^{ u}$ を $Q^{ u}$ に置き換えたアブレーションよりも優れた結果を示しており、正則化に行動方策の Q 値を用いる重要性が示された。
  • AlgaeDICE と比較して、本手法は優れた性能を示した。AlgaeDICE はミニマックス最適化の不安定性のため、性能が著しく劣っていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。