Skip to main content
QUICK REVIEW

[論文レビュー] Inverse Reinforcement Learning with the Average Reward Criterion

Feiyang Wu, Jingyang Ke|arXiv (Cornell University)|May 24, 2023
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、平均報酬基準に基づく逆強化学習フレームワークを提案し、平均報酬MDPを解くために確率的ポリシーミラー降下(SPMD)を導入するとともに、逆強化学習のために逆ポリシーミラー降下(IPMD)を提案する。SPMDは$Ó(1/\varepsilon)$の収束を達成し、IPMDは$Ó(1/\varepsilon^2)$の収束を達成する。一般関数近似を用いた平均報酬設定における逆強化学習のための最初の有限時間収束解析を提供する。

ABSTRACT

We study the problem of Inverse Reinforcement Learning (IRL) with an average-reward criterion. The goal is to recover an unknown policy and a reward function when the agent only has samples of states and actions from an experienced agent. Previous IRL methods assume that the expert is trained in a discounted environment, and the discount factor is known. This work alleviates this assumption by proposing an average-reward framework with efficient learning algorithms. We develop novel stochastic first-order methods to solve the IRL problem under the average-reward setting, which requires solving an Average-reward Markov Decision Process (AMDP) as a subproblem. To solve the subproblem, we develop a Stochastic Policy Mirror Descent (SPMD) method under general state and action spaces that needs $\mathcal{O}(1/\varepsilon)$ steps of gradient computation. Equipped with SPMD, we propose the Inverse Policy Mirror Descent (IPMD) method for solving the IRL problem with a $\mathcal{O}(1/\varepsilon^2)$ complexity. To the best of our knowledge, the aforementioned complexity results are new in IRL. Finally, we corroborate our analysis with numerical experiments using the MuJoCo benchmark and additional control tasks.

研究の動機と目的

  • 割引MDPにおける既存の逆強化学習手法が割引率を事前に知っているという制限を解消すること。
  • 長期的で定常的な行動をより適切にモデル化する平均報酬基準に基づく逆強化学習の理論的枠組みを構築すること。
  • 特に一般状態空間および一般行動空間を想定した平均報酬設定における逆強化学習アルゴリズムの有限時間収束保証を提供すること。
  • 最大エントロピーの原則を平均報酬逆強化学習定式化に統合することで、報酬回復のあいまいさを解消すること。
  • 理論的収束レートを保証する一次の確率的最適化手法を用いて、効率的かつスケーラブルな逆強化学習を実現すること。

提案手法

  • 一般状態空間および一般行動空間を想定した非線形関数近似を用いて、平均報酬MDP(AMDP)を解く一次の手法、確率的ポリシーミラー降下(SPMD)を導入する。
  • 性能差分補題を用いて収束バウンドを確立し、特定の関数クラスでは$Ó(1/\varepsilon)$ステップ、一般関数近似では$Ó(1/\varepsilon^2)$ステップを示す。
  • 平均報酬フレームワーク下での最大エントロピー逆強化学習の双対定式化として、逆ポリシーミラー降下(IPMD)を提案し、専門家とエージェントの平均報酬の差異を最小化する。
  • IPMDの解析に二段階スケールの確率的近似フレームワークを採用し、各反復でSPMDが内側のエントロピー正則化強化学習問題を解く。
  • 誤差バウンドを$Ó(\cdot)$表記で取り入れ、近似誤差を制御する安定性項$\nu$および$C_d$を活用する。
  • 訓練中の目的関数の発散を防ぐために、予測報酬のノルムの0.05倍の正則化項を導入する。
Figure 1: Reward recovery performance of IPMD and IQ-Learn. The lower the bar, the better the performance.
Figure 1: Reward recovery performance of IPMD and IQ-Learn. The lower the bar, the better the performance.

実験結果

リサーチクエスチョン

  • RQ1一般関数近似を用いた場合に、平均報酬基準における逆強化学習の有限時間収束解析を構築できるか。
  • RQ2確率的一次の最適化手法を用いて、逆強化学習における基本的な平均報酬MDP(AMDP)サブ問題を効率的に解けるか。
  • RQ3最大エントロピー正則化を施した平均報酬設定における一次逆強化学習アルゴリズムの収束レートは何か。
  • RQ4SPMDは非線形関数近似を用いたAMDPにおいて$Ó(1/\varepsilon)$の収束を達成できるか。一般ケースでは$Ó(1/\varepsilon^2)$の収束を達成できるか。
  • RQ5提案されたIPMD手法は、報酬回復の正確性とサンプル効率の面で、最先端の逆強化学習手法と比較してどのように差をつけるか。

主な発見

  • SPMDアルゴリズムは、AMDPを解く非線形関数近似器の特定クラスにおいて$Ó(1/\varepsilon)$の収束を達成する。
  • 一般関数近似の文脈では、SPMDは$Ó(1/\varepsilon^2)$ステップで収束し、AMDPにおける確率的ポリシー最適化の新しい理論的バウンドを確立する。
  • 平均報酬基準下での逆強化学習のためのIPMDアルゴリズムは$Ó(1/\varepsilon^2)$の収束レートを達成する。これは、この設定における最初の有限時間収束解析である。
  • MuJoCoベンチマークにおける数値実験では、IPMDが最先端の手法を上回り、報酬回復誤差を顕著に低減することが示された。
  • 提案されたアルゴリズムは、制御タスク全体にわたり安定した性能を示し、GANベースやサンプリングベースの逆強化学習手法と比較して、訓練の安定性とサンプル効率が向上した。
  • 報酬関数への小さなL2正則化の導入により、目的関数の発散が防止され、訓練の安定性が維持されたが、理論的収束には影響を及ぼさなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。