Skip to main content
QUICK REVIEW

[論文レビュー] Improving Policy Gradient by Exploring Under-appreciated Rewards

Ofir Nachum, Mohammad Norouzi|arXiv (Cornell University)|Nov 28, 2016
Viral Infectious Diseases and Gene Expression in Insects被引用数 5
ひとこと要約

本論文は、報酬が期待値を上回る行動系列に注目することで探索を向上させる、新しい方策勾配法であるUnder-appreciated Reward Exploration (UREX) を提案する。UREX はサンプル効率とロバスト性を向上させ、スパースな報酬フィードバックのみを用いて、最初にモデルフリー強化学習で複数桁の加算を成功裏に解けるようにし、一部のケースでは2000桁のシーケンスへの一般化を達成した。

ABSTRACT

This paper presents a novel form of policy gradient for model-free reinforcement learning (RL) with improved exploration properties. Current policy-based methods use entropy regularization to encourage undirected exploration of the reward landscape, which is ineffective in high dimensional spaces with sparse rewards. We propose a more directed exploration strategy that promotes exploration of under-appreciated reward regions. An action sequence is considered under-appreciated if its log-probability under the current policy under-estimates its resulting reward. The proposed exploration strategy is easy to implement, requiring small modifications to an implementation of the REINFORCE algorithm. We evaluate the approach on a set of algorithmic tasks that have long challenged RL methods. Our approach reduces hyper-parameter sensitivity and demonstrates significant improvements over baseline methods. Our algorithm successfully solves a benchmark multi-digit addition task and generalizes to long sequences. This is, to our knowledge, the first time that a pure RL method has solved addition using only reward feedback.

研究の動機と目的

  • モデルフリー強化学習におけるスパース報酬の課題、特に長く正確な行動系列を必要とするアルゴリズム的タスクに対して、解決を図ること。
  • エントロピー正則化や $ε$-greedy などの非指向的探索戦略が、高次元かつスパース報酬環境では失敗することを克服すること。
  • 現在の方策によって未評価とされている行動系列、すなわち予想を上回る報酬をもたらすものに、能動的に探索を向ける方法を開発すること。
  • 強力な教師信号なしに、純粋な強化学習によって複雑なアルゴリズム的タスク(例:複数桁の加算)を解けるようにすること。
  • ハイパーパrameterのロバスト性と一般化性能、特に長期間シーケンス一般化タスクにおける性能を向上させること。

提案手法

  • UREX は、REINFORCE方策勾配の目的関数を、実際に得られた報酬が方策の予測された対数尤度を上回る行動系列の探索を促進する項を組み込むことで変更する。
  • 重要度サンプリングを用いて、標準的なREINFORCE項と、対数尤度と観測報酬の不一致を是正する平均を求める項の組み合わせ目的関数の勾配を推定する。
  • 本手法は、現在の方策における対数尤度が実際に得られた報酬に対して低すぎる行動系列を、未評価のものと特定する。
  • 重要度サンプリングの重みを正規化し、トラジェクトリにわたる報酬および正規化された重みの平均を引くことで、分散を低減する。
  • REINFORCEへの最小限の変更で実装されており、方策勾配の更新ルールの変更のみを要する。
  • カリキュラム学習スケジュールを用い、短いシーケンスで高い性能を達成した段階で、徐々にシーケンス長を延長する。

実験結果

リサーチクエスチョン

  • RQ1エントロピー正則化や $ε$-greedy 探索に依存せずに、期待値を上回る報酬をもたらす未評価の行動系列を効果的に探索できる方策勾配法は存在するか?
  • RQ2未評価領域に注目することで、スパース報酬のアルゴリズム的タスク(例:複数桁の加算)におけるサンプル効率と性能が向上するか?
  • RQ333桁までしかトレーニングしていないにもかかわらず、2000桁の加算シーケンスへの一般化が、UREX によって可能になるか?
  • RQ4中間報酬を用いた価値ベース手法(例:1ステップQ学習)と比較して、UREX は性能とハイパーパrameter感受性の点で優れているか?
  • RQ5複数桁の加算など、従来の純粋なRLアプローチでは困難であったアルゴリズム的タスクを、エピソード報酬フィードバックのみで解けるか?

主な発見

  • UREX は、エピソード報酬フィードバックのみを用いて、複数桁の加算タスクを成功裏に解いた。これは、教師なしでこれを達成した最初の純粋なモデルフリー強化学習手法である。
  • 5回のランダムリスタートのうち2回で、UREXエージェントは33桁までしかトレーニングしていないにもかかわらず、2000桁の加算シーケンスへの完全な一般化を達成した。
  • UREX は、エントロピー正則化REINFORCE や1ステップQ学習よりも顕著に優れた性能を示し、特に複数桁の加算のような最も挑戦的なタスクで顕著であった。
  • ハイパーパrameter感受性が低く抑えられ、ベースライン手法と比較して、よりロバストで、広範なチューニングに依存しなくなった。
  • BinarySearch タスクでは、エージェントが2進探索と線形探索の中間のハイブリッド戦略を学習したが、正しさは達成されたものの、効率は完全に最適化されていなかった。
  • Copy および ReversedAddition タスクでは、UREX は強力な一般化性能を示し、詳細な結果は付録Cに報告されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。