Skip to main content
QUICK REVIEW

[論文レビュー] Noise, overestimation and exploration in Deep Reinforcement Learning

Rafael Stekolshchik|arXiv (Cornell University)|Jun 25, 2020
Reinforcement Learning in Robotics参考文献 6被引用数 7
ひとこと要約

本論文は、深層強化学習におけるノイズの二重的役割に焦点を当てている:価値関数推定における有害な過大評価の原因となる一方で、有益な探索メカニズムとしても機能する点。DQN、Double DQN、DDPG、TD3、Hill-Climbingにおけるノイズの影響を分析し、特にPyBullet環境(HopperBulletEnvおよびWalker2DBulletEnv)におけるTD3のノイズパラメータのチューニングに注目。また、探索効率の向上を目的として、Hill-Climbingにおける適応的ノイズの導入を提案する。

ABSTRACT

We will discuss some statistical noise related phenomena, that were investigated by different authors in the framework of Deep Reinforcement Learning algorithms. The following algorithms are touched: DQN, Double DQN, DDPG, TD3, Hill-Climbing. Firstly, we consider overestimation, that is the harmful property resulting from noise. Then we deal with noise used for exploration, this is the useful noise. We discuss setting the noise parameter in TD3 for typical PyBullet environments associated with articulate bodies such as HopperBulletEnv and Walker2DBulletEnv. In the appendix, in relation with the Hill-Climbing algorithm, we will look at one more example of noise: adaptive noise.

研究の動機と目的

  • DQN や Double DQN などの価値ベースの深層強化学習アルゴリズムにおいて、統計的ノイズがどのように過大評価を引き起こすかを理解すること。
  • DDPG や TD3 などのアクター・クリティック法におけるノイズを用いた効果的な探索戦略の有効性を検討すること。
  • PyBullet環境における歩行タスクにおいて、TD3のノイズパラメータを設定するための実証的指針を提供すること。
  • 探索効率の向上を目的として、Hill-Climbingにおける適応的ノイズ機構を検討すること。

提案手法

  • ブートストラップターゲットにおけるノイズが価値ネットワークに及ぼす過大評価バイアスを分析し、特にDQNおよびDouble DQNにおいて検証。
  • DDPGおよびTD3における行動選択におけるノイズインジェクションを、特に連続的制御タスクにおける探索戦略として評価。
  • HopperBulletEnvおよびWalker2DBulletEnvにおけるTD3のノイズスケールハイパーパrameterを実証的にチューニングし、探索と安定性のバランスを図る。
  • 学習進行状況および勾配の大きさに基づいてノイズの大きさを調整する適応的ノイズを導入し、その有効性を評価。

実験結果

リサーチクエスチョン

  • RQ1DQNおよびDouble DQNにおいて、価値関数ターゲットのノイズがどのように過大評価を引き起こすか?
  • RQ2TD3におけるノイズベース探索は、PyBulletの歩行環境においてどれほどサンプル効率を向上させるか?
  • RQ3HopperBulletEnvおよびWalker2DBulletEnvにおいて、探索と収束のバランスを取るために、TD3でどのノイズスケールが最適か?
  • RQ4Hill-Climbingにおける適応的ノイズは、固定ノイズ探索と比較して収束速度および最終的パフォーマンスでどのように異なるか?

主な発見

  • 価値関数ターゲットにおけるノイズは、DQNおよびDouble DQNにおいて顕著な過大評価を引き起こし、特に分散の大きい環境では顕著である。
  • 適切にチューニングされたノイズスケールを有するTD3は、HopperBulletEnvおよびWalker2DBulletEnvで安定した学習と向上したサンプル効率を達成する。
  • TD3における最適なノイズスケールは環境によって異なるが、一般的に初期学習段階で高い値が探索を向上させる。
  • Hill-Climbingにおける適応的ノイズは、手動によるハイパーパramータチューニングの必要性を低減し、スパarsely報酬の設定において収束を加速する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。