Skip to main content
QUICK REVIEW

[論文レビュー] ARCHER: Aggressive Rewards to Counter bias in Hindsight Experience Replay

Sameera Lanka, Tianfu Wu|arXiv (Cornell University)|Sep 6, 2018
Reinforcement Learning in Robotics参考文献 29被引用数 21
ひとこと要約

ARCHERは、後向きに考慮される経験(ヒンターリンクス経験)に対するバイアスを是正する手法を提案する。具体的には、ヒンターリンクス経験に対してより攻撃的(数値的に高い)報酬を適用することで、スパースまたはバイナリ報酬を伴う深層強化学習におけるサンプル効率を顕著に向上させる。DeepMind Control SuiteのReacherおよびFinger環境における実験では、多様な報酬関数やタスクの複雑さに対しても、ARCHERは一貫して元のHERを上回る性能を示した。

ABSTRACT

Experience replay is an important technique for addressing sample-inefficiency in deep reinforcement learning (RL), but faces difficulty in learning from binary and sparse rewards due to disproportionately few successful experiences in the replay buffer. Hindsight experience replay (HER) was recently proposed to tackle this difficulty by manipulating unsuccessful transitions, but in doing so, HER introduces a significant bias in the replay buffer experiences and therefore achieves a suboptimal improvement in sample-efficiency. In this paper, we present an analysis on the source of bias in HER, and propose a simple and effective method to counter the bias, to most effectively harness the sample-efficiency provided by HER. Our method, motivated by counter-factual reasoning and called ARCHER, extends HER with a trade-off to make rewards calculated for hindsight experiences numerically greater than real rewards. We validate our algorithm on two continuous control environments from DeepMind Control Suite - Reacher and Finger, which simulate manipulation tasks with a robotic arm - in combination with various reward functions, task complexities and goal sampling strategies. Our experiments consistently demonstrate that countering bias using more aggressive hindsight rewards increases sample efficiency, thus establishing the greater benefit of ARCHER in RL applications with limited computing budget.

研究の動機と目的

  • ヒンターリンクス経験が、実際の経験と同等に扱われるというHindsight Experience Replay(HER)における根本的なバイアスに対処すること。これは、再現されたヒンターリンクス軌道の発生確率が過大評価されていることに起因する。
  • 特にスパースまたはバイナリ報酬を伴う高次元連続制御タスクにおいて、深層強化学習のサンプル効率を向上させること。
  • 実際の報酬を超えてヒンターリンクス報酬の数値を大きくすることで、学習性能が向上することを実証的に検証すること。
  • 下位のアルゴリズム構造を変更せずに、シンプルで効果的かつ頑健なHERの強化手法を提供すること。

提案手法

  • ARCHERは、実際の報酬(λʳ)とヒンターリンクス報酬(λʰ)の重み付きトレードオフを導入し、λʳ < λʰ となるように設定することで、ヒンターリンクス報酬の数値を大きくする。
  • 反事後的推論を適用してヒンターリンクスバイアスを是正し、成功したゴール再ラベル化をもたらすヒンターリンクス経験を、より情報量が多いとみなす。
  • DDPGなどの既存のオフポリシー手法を拡張し、リプレイ中に調整された報酬値を用いて損失関数を再重み付けする。
  • 訓練中に実経験とヒンターリンクス経験の寄与度をバランスさせるために、線形的なトレードオフパラメータ化を用いる。
  • この手法は、下位の強化学習アルゴリズムに依存しないように設計されており、DDPG、DQN、その他のオフポリシー手法とも容易に統合可能である。
  • 実験では、エージェントの軌道から将来のゴールをサンプリングしてヒンターリンクス経験を生成するゴール再ラベル化を用い、報酬はλʳ/λʰ比に従ってスケーリングされる。

実験結果

リサーチクエスチョン

  • RQ1ヒンターリンクス経験リプレイ(HER)は、再現されたヒンターリンクス軌道の発生確率を過大評価することで、系統的なバイアスを生じさせるか?
  • RQ2実際の報酬を超えてヒンターリンクス報酬の数値を大きくすることで、このバイアスを軽減し、サンプル効率を向上させられるか?
  • RQ3提案手法ARCHERは、バイナリ正報酬、負報酬、および形状報酬を含む多様な報酬関数に対して、頑健であるか?
  • RQ4連続制御環境におけるさまざまなタスクの複雑さやゴールサンプリング戦略に対し、ARCHERは優れた性能を維持するか?
  • RQ5ARCHERの利点が時間経過とともに減少するか、すなわち適応的報酬スケジューリングの必要性が生じるか?

主な発見

  • DeepMind Control SuiteのReacherおよびFinger環境において、ARCHERは両環境で一貫して元のHERを上回るサンプル効率を示した。
  • スパースなバイナリ負報酬設定では、λʳ < λʰ であるARCHERは、元のHERよりも収束が速く、最終的な性能も優れている。
  • 正のバイナリ報酬関数を用いた場合でも、ARCHERの性能は依然として優れており、報酬の符号に対して頑健であることが確認された。
  • 高次元制御タスク(例:Finger)においても、ARCHERは数千ステップの訓練後も顕著な性能優位を維持した。
  • 密度の高い負報酬と大きなターゲット球を用いた状況でも、ARCHERは元のHERを上回り、複雑でスパースな状況下でも有効であることが示された。
  • 形状報酬の設定に対しても、ARCHERは有効であり、元のHERが以前に報告された性能劣化を示した状況でも効果を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。