Skip to main content
QUICK REVIEW

[論文レビュー] Model-Based Offline Reinforcement Learning with Pessimism-Modulated Dynamics Belief

Kaiyang Guo, Yunfeng Shao|arXiv (Cornell University)|Oct 13, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本稿では、動的モデルの信念分布を維持し、方策最適化にバイアス付きサンプリングを用いるモデルベースのオフライン強化学習手法であるPessimism-Modulated Dynamics Belief (PMDB) を提案する。オフラインRLを交替的マルコフゲーム(AMG)として定式化することで、方策の慎重さに基づいて動的モデルの信念を動的に再重み付けし、報酬に対する明示的な不確実性ペナルティなしに、D4RLベンチマークで最先端の性能を達成する。

ABSTRACT

Model-based offline reinforcement learning (RL) aims to find highly rewarding policy, by leveraging a previously collected static dataset and a dynamics model. While the dynamics model learned through reuse of the static dataset, its generalization ability hopefully promotes policy learning if properly utilized. To that end, several works propose to quantify the uncertainty of predicted dynamics, and explicitly apply it to penalize reward. However, as the dynamics and the reward are intrinsically different factors in context of MDP, characterizing the impact of dynamics uncertainty through reward penalty may incur unexpected tradeoff between model utilization and risk avoidance. In this work, we instead maintain a belief distribution over dynamics, and evaluate/optimize policy through biased sampling from the belief. The sampling procedure, biased towards pessimism, is derived based on an alternating Markov game formulation of offline RL. We formally show that the biased sampling naturally induces an updated dynamics belief with policy-dependent reweighting factor, termed Pessimism-Modulated Dynamics Belief. To improve policy, we devise an iterative regularized policy optimization algorithm for the game, with guarantee of monotonous improvement under certain condition. To make practical, we further devise an offline RL algorithm to approximately find the solution. Empirical results show that the proposed approach achieves state-of-the-art performance on a wide range of benchmark tasks.

研究の動機と目的

  • 静的データセットを超えた動的モデルの一般化を向上させることで、オフライン強化学習における分布シフト問題に対処すること。
  • モデルベースのオフライン強化学習における報酬ベースの不確実性ペナルティの限界を克服し、過度な慎重さを避けること。
  • 明示的なQ値または報酬ペナルティに依存せずに、動的モデルの不確実性を方策学習に統合する原理的かつ整合性のある手法を開発すること。
  • 方策依存的な再重み付けを通じて自然に慎重な行動を誘導する信念ベースの方策最適化フレームワークを形式化すること。
  • サンプル効率性と頑健性を維持しながら、標準的なオフライン強化学習ベンチマークで最先端の性能を達成すること。

提案手法

  • 方策と動的モデルの敵対的側面の間で交替的マルコフゲーム(AMG)を定式化し、慎重な行動を誘導する。
  • 動的モデルの信念分布を維持し、方策依存的な再重み付けにより慎重さを反映させる。
  • AMG定式化から導かれるバイアス付きサンプリング手順を用い、Pessimism-Modulated Dynamics Belief (PMDB) を自然に誘導する。
  • 特定の条件下で単調増加の改善保証を持つ反復的正則化方策最適化アルゴリズムを提案する。
  • Q関数と動的モデル信念の共同学習を目的とした訓練目的関数を用いて、AMG解を近似する実用的なオフラインRLアルゴリズムを設計する。
  • AMGと実験的MDP損失を両方統合し、信念学習とデータ駆動学習のバランスを調整可能な重み付けを可能にする。

実験結果

リサーチクエスチョン

  • RQ1報酬に対する明示的なペナルティなしに、オフライン強化学習における動的モデルの不確実性を効果的にモデル化できるか。特に過度な慎重さを回避できるか。
  • RQ2方策依存的に動的モデルの信念分布を更新することで、慎重さを反映させることは可能か。
  • RQ3交替的マルコフゲーム(AMG)の定式化は、オフライン設定において安定かつ改善が見られる方策最適化プロセスを導くか。
  • RQ4信念に基づくサンプリングは、分布外の状態行動ペairを処理する際に、不確実性に基づく報酬ペナルティを上回る性能を示すか。
  • RQ5提案手法は、多様なオフライン強化学習ベンチマークで最先端の性能を達成できるか。

主な発見

  • 提案手法PMDBは、D4RLベンチマークスイートで最先端の性能を達成し、RAMBOを含む先行手法を大多数のタスクで上回る。
  • hopper-mediumタスクでは106.8 ± 0.2を達成し、CQL(61.9 ± 6.4)、MOReL(84.0 ± 17.0)、RAMBO(87.0 ± 15.4)を上回る。
  • walker2d-mediumでは94.2 ± 1.1を記録し、BEAR(59.8 ± 40.0)、BRAC(59.7 ± 39.9)、RAMBO(84.9 ± 2.6)を上回る。
  • halfcheetah-mediumでは75.6 ± 1.3を達成し、CQL(46.9 ± 0.4)、MOReL(60.7 ± 4.4)、RAMBO(77.9 ± 4.0)を上回る。
  • ランダム、中程度、エキスパート、リプレイデータセットを含む多様なデータセットタイプに対して、頑健な性能を示し、優れた一般化能力を示す。
  • アブレーションスタディの結果、AMG損失とMDP損失の重み付けに依存しない性能の安定性が示され、安定した学習ダイナミクスを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。