[論文レビュー] On-Policy Deep Reinforcement Learning for the Average-Reward Criterion
本稿では、長期間にわたるタスクを対象として、長期平均報酬基準を直接最適化する新しいオンポリシー深層強化学習アルゴリズム、Average-Reward TRPO(ATRPO)を提案する。平均方策差異とケメンズ定数に基づく理論的に裏付けられた方策改善の上限を導出し、単調な方策改善を可能にする。ATRPOは、特に高次元制御タスクにおいて、標準的なTRPOを著しく上回る性能を発揮する。
We develop theory and algorithms for average-reward on-policy Reinforcement Learning (RL). We first consider bounding the difference of the long-term average reward for two policies. We show that previous work based on the discounted return (Schulman et al., 2015; Achiam et al., 2017) results in a non-meaningful bound in the average-reward setting. By addressing the average-reward criterion directly, we then derive a novel bound which depends on the average divergence between the two policies and Kemeny's constant. Based on this bound, we develop an iterative procedure which produces a sequence of monotonically improved policies for the average reward criterion. This iterative procedure can then be combined with classic DRL (Deep Reinforcement Learning) methods, resulting in practical DRL algorithms that target the long-run average reward criterion. In particular, we demonstrate that Average-Reward TRPO (ATRPO), which adapts the on-policy TRPO algorithm to the average-reward criterion, significantly outperforms TRPO in the most challenging MuJuCo environments.
研究の動機と目的
- 標準的な深層強化学習アルゴリズムが割引報酬を最適化するのに対し、現実の継続的タスクでは長期平均報酬の最大化が求められるというギャップを是正すること。
- 元々割引設定のために導出された既存の方策改善上限が、平均報酬MDPに適用された場合に生じる制限を克服すること。
- 長期間平均報酬の差の新しい下界を用いて、平均報酬基準を直接最適化する理論的に妥当なオンポリシー手法を開発すること。
- 標準的なTRPOと比較して、高次元で困難なMuJoCo制御ベンチマークにおいて、提案手法の実用的優位性を示すこと。
- 特にオンポリシー手法に適した、現代の深層強化学習パイプラインに平均報酬最適化を統合するフレームワークを確立すること。
提案手法
- 平均方策差異とケメンズ定数(マルコフ連鎖の混合時間の指標)に依存する、2つの方策間の平均報酬差の新しい下界を導出する。
- この下界を最大化することで、平均報酬における単調な改善が達成されることを示し、政策改善定理を平均報酬設定に拡張する。
- 信頼領域方策最適化(TRPO)アルゴリズムを平均報酬基準に適応させ、平均報酬TRPO(ATRPO)アルゴリズムを導出する。
- 価値関数の近似に一般化された利得推定(GAE)を用い、ミニバッチごとに利得を正規化して学習の安定化を図る。
- 無限時間スパンのダイナミクスをシミュレートし、割引法と公平に比較可能にするために、MuJoCo環境にリセットコスト機構を実装する。
- 同一のハイパーパramータとランダムシードを用いてATRPOとTRPOを学習・評価し、さまざまな長さの評価軌道を用いて性能の安定性を評価する。
実験結果
リサーチクエスチョン
- RQ1割引報酬に基づく上限がこの文脈で失敗するのを避けるために、平均報酬基準に理論的に裏付けられた方策改善上限を導出できるか?
- RQ2深層強化学習における継続的タスクにおいて、平均報酬基準を直接最適化することは、大きな割引率を使用するのと比較して優れた性能をもたらすか?
- RQ3高次元のMuJoCo制御タスクにおいて、ATRPOは標準的なTRPOと比べて、サンプル効率および最終的性能で優れているか?
- RQ4無限時間スパンのダイナミクスをシミュレートするために使用されるリセットコストの変更に、ATRPOの性能が感受的であるか?
- RQ5提案された平均報酬フレームワークは、TRPOのような現代のオンポリシー深層強化学習アルゴリズムと効果的に組み合わせられるか?
主な発見
- 平均報酬設定に導出した方策改善上限は意味的であり、単調な改善を保証する。これに対して、従来の割引報酬に基づく上限は、この文脈では失敗する。
- ATRPOは、すべてのMuJoCo環境においてTRPOを著しく上回り、特にHumanoidやAntのような最も困難なタスクでは、顕著な性能向上を示す。
- リセットコストを広範囲に変更してもATRPOは安定した性能を維持しており、シミュレーション設定におけるハイパーパramータ選択へのロバストネスを示している。
- リセットコストの有無に関わらず、ATRPOはTRPOを上回る性能を発揮しており、改善効果がリセットメカニズムに起因するのではなく、根本的な平均報酬最適化に起因していることを示している。
- 評価軌道が長くなる(例:10,000ステップ)ほど、ATRPOとTRPOの性能差が拡大する。これは、ATRPOが割引ベースのベースラインよりも長期的な振る舞いをよりよく捉えていることを確認している。
- 理論的上限にケメンズ定数を用いることで、連鎖の混合性を意味のある指標として得ることができ、理論的性質と実用的アルゴリズム設計を結びつける。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。