Skip to main content
QUICK REVIEW

[論文レビュー] Synthetic Returns for Long-Term Credit Assignment

David Raposo, Samuel Ritter|arXiv (Cornell University)|Feb 24, 2021
Reinforcement Learning in Robotics参考文献 24被引用数 12
ひとこと要約

本稿では、過去の状態と遠く離れた将来の報酬との間接的関連をモデル化することで、長期的報酬割り当てを改善するための状態関連学習(SA学習)を提案する。これにより、状態が将来の報酬に与える貢献を推定する「合成リターン」(SR)の計算が可能となり、報酬割り当ての解釈可能性が向上する。標準的な時系列差分学習(TD学習)と組み合わせることで、SRを補完するエージェントは、従来の最先端手法に比べてAtari Skiingを25倍速く解消する。これは、遅延報酬環境における優れたサンプル効率性と解釈可能性を示している。

ABSTRACT

Since the earliest days of reinforcement learning, the workhorse method for assigning credit to actions over time has been temporal-difference (TD) learning, which propagates credit backward timestep-by-timestep. This approach suffers when delays between actions and rewards are long and when intervening unrelated events contribute variance to long-term returns. We propose state-associative (SA) learning, where the agent learns associations between states and arbitrarily distant future rewards, then propagates credit directly between the two. In this work, we use SA-learning to model the contribution of past states to the current reward. With this model we can predict each state's contribution to the far future, a quantity we call "synthetic returns". TD-learning can then be applied to select actions that maximize these synthetic returns (SRs). We demonstrate the effectiveness of augmenting agents with SRs across a range of tasks on which TD-learning alone fails. We show that the learned SRs are interpretable: they spike for states that occur after critical actions are taken. Finally, we show that our IMPALA-based SR agent solves Atari Skiing -- a game with a lengthy reward delay that posed a major hurdle to deep-RL agents -- 25 times faster than the published state-of-the-art.

研究の動機と目的

  • 長期的な報酬遅延が生じる強化学習の課題に対処する。標準的な時系列差分(TD)学習は、長時間にわたるシーケンスにおける高い分散と劣った報酬割り当ての問題を抱える。
  • 報酬伝搬を遮蔽する関係のない中間イベントが存在する環境において、TD学習の限界を克服する。
  • 長時間の遅延と関係のないイベントを挟んでも、将来の報酬から過去の状態への報酬割り当てを直接的に行う手法を開発する。
  • スパarsな遅延報酬を伴うタスク(例:Atari Skiing)において、深層強化学習エージェントが効率的に学習できるようにする。
  • 深層強化学習における報酬割り当てのサンプル効率性と解釈可能性を向上させる。

提案手法

  • ゲート付き再帰的アーキテクチャを用いて、過去の状態が将来の報酬に与える影響をモデル化するメモリ貢献関数 c(s_t) を学習する。
  • 現在のタイムステップの報酬を、ベースライン b(s_t) と過去の状態からの貢献 c(s_t) の和として予測するモデルを訓練し、合成リターン推定値を形成する。
  • リターン信号を個々の過去の状態からの貢献に分解することで、段階的バックプロパゲーションなしに直接的な報酬割り当てを可能にする。
  • 標準的なTD学習に合成リターン(SR)を統合し、報酬最適化のための代替的リターン信号として使用する。
  • エピソードメモリを用いて状態表現を保存し、報酬割り当て中に過去の状態を再取得可能にする。
  • IMPALAなどの市販エージェントに合成リターンを追加することで、アーキテクチャの大幅な変更なしに長期間タスクでの性能向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1長時間の遅延と関係のないイベントを挟んでも、状態関連学習は、将来の報酬から遠く離れた過去の状態に対して適切に報酬割り当てを実行できるか?
  • RQ2合成リターンの使用は、遅延報酬を伴うタスクにおける深層強化学習エージェントのサンプル効率性を向上させるか?
  • RQ3学習された合成リターンは、特に重要な行動の周辺で、状態の重要性を意味的に示す指標として解釈可能か?
  • RQ4SRを補完するエージェントは、Atari Skiingにおける学習速度とパフォーマンス面で、Agent57などの最先端エージェントと比較してどうなるか?
  • RQ5この手法は、Atari Skiingを越えて、多様な長期的報酬割り当てタスクに一般化可能か?

主な発見

  • SRを補完するIMPALAエージェントは、合成リターンを備えないベースラインIMPALAエージェントが学習に失敗する中、Atari Skiingで人間水準のパフォーマンスを達成した。
  • SRを補完するエージェントは、以前に発表された最先端手法であるAgent57に比べ、環境ステップ数を25倍も削減してAtari Skiingを解消した。
  • 合成リターンは、重要な行動の直後に発生する状態でピークを示し、解釈可能性と意味的な報酬割り当てを示している。
  • 干渉要因が関係のない場合やノイズが多い場合でも、この手法は長時間にわたる遅延を経て報酬割り当てを成功させた。
  • このアプローチは、元の強化学習エージェントのアーキテクチャを変更することなく、サンプル効率性を向上させた。これは、既存の深層強化学習フレームワークと高い互換性を持つことを示している。
  • 強力なパフォーマンスを発揮しているが、シードのばらつきとハイパーパramータへの感受性が顕著に見られ、耐性の向上の余地があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。