Skip to main content
QUICK REVIEW

[論文レビュー] WD3: Taming the Estimation Bias in Deep Reinforcement Learning

Qiang He, Xinwen Hou|arXiv (Cornell University)|Jun 18, 2020
Reinforcement Learning in Robotics参考文献 20被引用数 4
ひとこと要約

WD3は、深層強化学習における2つのクライアントを重み付き平均化するメカニズムを提案し、価値関数推定における過大評価と過小評価バイアスを同時に低減する。学習可能な重みβを用いて2つのクライアントの凸結合を学習することで、WD3はより正確な価値推定を達成し、DDPGやTD3と比較してサンプル効率と連続制御タスクにおける性能が向上する。

ABSTRACT

The overestimation phenomenon caused by function approximation is a well-known issue in value-based reinforcement learning algorithms such as deep Q-networks and DDPG, which could lead to suboptimal policies. To address this issue, TD3 takes the minimum value between a pair of critics. In this paper, we show that the TD3 algorithm introduces underestimation bias in mild assumptions. To obtain a more precise estimation for value function, we unify these two opposites and propose a novel algorithm \underline{W}eighted \underline{D}elayed \underline{D}eep \underline{D}eterministic Policy Gradient (WD3), which can eliminate the estimation bias and further improve the performance by weighting a pair of critics. To demonstrate the effectiveness of WD3, we compare the learning process of value function between DDPG, TD3, and WD3. The results verify that our algorithm does eliminate the estimation error of value functions. Furthermore, we evaluate our algorithm on the continuous control tasks. We observe that in each test task, the performance of WD3 consistently outperforms, or at the very least matches, that of the state-of-the-art algorithms\footnote{Our code is available at~\href{https://sites.google.com/view/ictai20-wd3/}{https://sites.google.com/view/ictai20-wd3/}.}.

研究の動機と目的

  • 価値ベースの深層強化学習アルゴリズムにおける、継続的な過大評価および過小評価バイアスの問題に対処すること。
  • TD3が2つのクライアントの最小値を用いることで過小評価バイアスが生じ、連続制御タスクでの性能を低下させることを特定すること。
  • 過大評価と過小評価を統合する新しいアルゴリズムを開発し、学習可能な重みを用いた二重クライアントの重み付き平均を用いてより正確な価値推定を達成すること。
  • WD3が連続制御環境におけるより良い価値関数推定を通じて、方策学習の安定性と性能を向上させることを実証すること。

提案手法

  • 学習可能なパラメータβを用いた2つのクライアントの重み付き平均ターゲット価値関数を提案し、過大評価と過小評価のバランスを取ること。
  • 修正されたターゲット価値計算を導入:y_target = r + γ * (β * Q1(s', a') + (1 - β) * Q2(s', a')) を行動価値関数推定に用いる。
  • DDPGやTD3と同様に遅延方策更新とターゲットネットワークスムージングを適用し、学習の安定化と過学習の低減を図ること。
  • TD3の最小演算子よりも、より強固で正確な価値推定を達成するため、2つのクライアントの凸結合を用いること。
  • エージェントとクライアントをエンドツーエンドで訓練し、ポリシー勾配の目的関数に従い、外れ値に敏感でないHuber損失を用いてクライアント損失を最小化すること。
  • バイアスと分散のバランスを取るために、調整可能なハイパーパrameter βを導入し、実験によりさまざまなβ値においても安定性が確認されている。

実験結果

リサーチクエスチョン

  • RQ1TD3が2つのクライアントの最小値を用いることで、連続制御タスクにおける過小評価バイアスが生じるか?
  • RQ22つのクライアントの重み付き組み合わせは、単一のクライアントや最小演算子と比較して、過大評価と過小評価バイアスの両方をより効果的に低減できるか?
  • RQ3WD3の価値関数推定は、DDPGやTD3と比較して、学習中の正確さと安定性の観点でどのように異なるか?
  • RQ4学習可能な重みβが、さまざまな環境におけるアルゴリズムの性能と耐性に与える影響は何か?
  • RQ5WD3は、連続制御ベンチマークにおいて、最先端のアルゴリズムを常に上回る性能向上を達成できるか?

主な発見

  • WD3は、訓練全体にわたり安定的かつ正確な価値関数推定が可能であり、DDPGやTD3を上回る性能を示すことで、価値関数学習における推定バイアスを顕著に低減した。
  • Ant環境では、WD3の価値関数推定はモンテカルロロールアウトで推定された真の値に近づいているが、DDPGは過大評価を示し、TD3は過大評価と過小評価の両方の段階を示している。
  • WD3は、OpenAI Gymのすべての連続制御環境で一貫した性能向上を達成し、最先端のアルゴリズムを上回るか、同等の性能を発揮した。
  • WD3のハイパーパrameter βは頑健である。さまざまな値でも性能が安定しており、WD3は広範なハイパーパrameterチューニングを必要としないことを示している。
  • WD3の学習プロセスは顕著な過大評価や過小評価を示さず、DDPGやTD3と比較して価値関数更新の安定性に優れていることが示された。
  • 理論的および実験的分析により、TD3の最小演算子が過小評価バイアスを生じることが確認され、WD3がクライアントの凸結合によってこれを効果的に緩和していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。