Skip to main content
QUICK REVIEW

[論文レビュー] Learning Long-Term Reward Redistribution via Randomized Return Decomposition

Zhizhou Ren, Ruihan Guo|arXiv (Cornell University)|Nov 26, 2021
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本稿では、スパースで遅延する報酬を伴うエピソード的強化学習における密度の高いプロキシ報酬を学習するスケーラブルな手法であるランダム化リターン分解(RRD)を提案する。報酬モデルを、ランダムな部分列セグメントから軌道リターンを再構築するように訓練することにより、RRDはミニバッチ最適化を可能にし、MuJoCoベンチマークにおいてベースラインを著しく上回る性能を達成する。これは理論的裏付けがあり、効率的な既存のリターン分解手法の代替手段を提供する。

ABSTRACT

Many practical applications of reinforcement learning require agents to learn from sparse and delayed rewards. It challenges the ability of agents to attribute their actions to future outcomes. In this paper, we consider the problem formulation of episodic reinforcement learning with trajectory feedback. It refers to an extreme delay of reward signals, in which the agent can only obtain one reward signal at the end of each trajectory. A popular paradigm for this problem setting is learning with a designed auxiliary dense reward function, namely proxy reward, instead of sparse environmental signals. Based on this framework, this paper proposes a novel reward redistribution algorithm, randomized return decomposition (RRD), to learn a proxy reward function for episodic reinforcement learning. We establish a surrogate problem by Monte-Carlo sampling that scales up least-squares-based reward redistribution to long-horizon problems. We analyze our surrogate loss function by connection with existing methods in the literature, which illustrates the algorithmic properties of our approach. In experiments, we extensively evaluate our proposed method on a variety of benchmark tasks with episodic rewards and demonstrate substantial improvement over baseline algorithms.

研究の動機と目的

  • 1つの軌道リターン信号しか得られないエピソード的強化学習における学習の課題に対処すること。
  • 報酬の誤指定により意図しない行動を引き起こす可能性がある手作業による報酬形状の限界を克服すること。
  • 真の環境リターンを近似する密度の高いプロキシ報酬を学習するスケーラブルでサンプル効率の良い手法を開発すること。
  • リターン分解を surrogate 最適化問題に再定式化することで、長時間スケールの信用配分を効果的に行うこと。
  • ランダム実装の理論的裏付けと、均等報酬再分配などの既存手法との関連を提供すること。

提案手法

  • 報酬モデルがランダムな状態行動ペアの部分列から全軌道リターンを予測する surrogate 最適化問題を提案する。
  • 長時間スケールのタスクにまで最小二乗に基づくリターン分解をスケーリングするために、モンテカルロサンプリングを用いる。
  • プロキシ報酬が、軌道ステップの小さなランダムサブセットから総リターンをほぼ再構築できるという構造的制約を定式化する。
  • ミニバッチ最適化を用いて報酬モデルを訓練することで、効率的でスケーラブルな学習を可能にする。
  • 理論的分析により、surrogate 損失が元の決定的リターン分解損失の上界であることが示される。
  • RRDと均等報酬再分配との関連を確立し、surrogate ガップを制御可能であることを示す。

実験結果

リサーチクエスチョン

  • RQ1リターン分解にランダムな部分列ベースのアプローチを用いることで、長時間スケールのエピソード的RLにおけるスケーラビリティが向上するか?
  • RQ2RRDにおける surrogate 損失は、元の決定的リターン分解目的関数とどのように関係しているか?
  • RQ3報酬モデル学習におけるランダム部分列サンプリングの理論的裏付けは何か?
  • RQ4長時間スケールのベンチマークにおいて、RRDは既存のプロキシ報酬学習手法と比較して性能とサンプル効率で優れているか?
  • RQ5RRDは、エキスパートが設計した報酬関数への依存を減らしながら、性能を維持または向上させることができるか?

主な発見

  • RRDは、エピソード的報酬を伴うMuJoCoベンチマークタスクのスイートにおいて、ベースラインアルゴリズムを著しく上回る性能を達成する。
  • 提案手法により、リターン分解における効果的なミニバッチ学習が可能となり、長時間スケールの問題へのスケーラビリティが著しく向上する。
  • surrogate 損失関数が、元の決定的リターン分解損失の上界であることが理論的に示され、健全な最適化の基盤が提供される。
  • RRDは均等報酬再分配と関連づけられ、surrogate ガップを制御可能であり、より高いロバストネスを実現できる。
  • 実験結果により、RRDは長時間スケールの制御タスクにおける学習効率と最終的性能で、既存手法を上回ることが示された。
  • この手法は、スパース報酬を密度の高い情報豊富なプロキシ報酬に効果的に再分配でき、より効果的なポリシー最適化を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。