Skip to main content
QUICK REVIEW

[論文レビュー] Reward Estimation for Variance Reduction in Deep Reinforcement Learning

Joshua Romoff, Peter Henderson|arXiv (Cornell University)|May 9, 2018
Reinforcement Learning in Robotics参考文献 39被引用数 12
ひとこと要約

この論文では、深層強化学習における分散を低減するための報酬推定手法を提案している。訓練中にノイズがかったり汚染されたサンプル報酬の代わりに、期待報酬の直接推定器を学習することで、分散を低減する。このアプローチにより、MuJoCoおよびAtari環境におけるさまざまな確率的ノイズタイプ下で、表計算および深層RL設定の両方において、サンプル効率と収束性が向上し、実証的に顕著な分散低減とパフォーランス向上が観察された。

ABSTRACT

Reinforcement Learning (RL) agents require the specification of a reward signal for learning behaviours. However, introduction of corrupt or stochastic rewards can yield high variance in learning. Such corruption may be a direct result of goal misspecification, randomness in the reward signal, or correlation of the reward with external factors that are not known to the agent. Corruption or stochasticity of the reward signal can be especially problematic in robotics, where goal specification can be particularly difficult for complex tasks. While many variance reduction techniques have been studied to improve the robustness of the RL process, handling such stochastic or corrupted reward structures remains difficult. As an alternative for handling this scenario in model-free RL methods, we suggest using an estimator for both rewards and value functions. We demonstrate that this improves performance under corrupted stochastic rewards in both the tabular and non-linear function approximation settings for a variety of noise types and environments. The use of reward estimation is a robust and easy-to-implement improvement for handling corrupted reward signals in model-free RL.

研究の動機と目的

  • ロボット工学において目標の指定が難しい状況においても、確率的または汚染された報酬信号によって引き起こされる深層強化学習における高い分散を是正すること。
  • 環境のダイナミクスをモデル化する必要がない実用的で、モデルフリーの手法を開発し、学習の安定性とサンプル効率を向上させること。
  • 生のサンプル報酬の代わりに期待報酬を推定することで、表計算および深層関数近似設定の両方で分散が低減され、パフォーランスが向上することを示すこと。
  • 従来の分散低減技術とは異なり報酬の汚染を明示的に処理しないが、シンプルでロバストかつ容易に実装可能な代替手法を提供すること。

提案手法

  • この手法では、各状態における局所的期待報酬を推定するための学習済み推定器 $ \hat{R}(s_t) $ を、サンプル報酬 $ r_t $ に置き換える。
  • 履歴の状態-報酬ペアを用いて、真の期待報酬に対して平均二乗誤差を最小化するように、別個のニューラルネットワークまたは関数近似器を訓練し、$ \hat{R}(s_t) $ を予測する。
  • 推定報酬 $ \hat{R}(s_t) $ は、ベルマンバックアップと方策勾配更新の両方で $ r_t $ の代わりに使用され、価値関数および方策学習における分散低減が達成される。
  • 価値関数 $ V^\pi(s_t) $ は、推定報酬を用いた時系列差分ターゲット $ Y_t = \hat{R}(s_t) + \gamma V^\pi(s_{t+1}) $ を用いて更新される。
  • このアプローチは、連続的制御(MuJoCo)および離散的制御(Atari)のベンチマークにおいて、表計算MDPおよび深層RLアルゴリズム(PPOおよびSAC)の両方へ適用可能である。
  • ダイナミクスのモデル化や計画を避けることで、報酬信号の補正にのみ焦点を当て、軽量かつ既存のモデルフリー強化学習フレームワークと互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1破損報酬信号下で、期待報酬の直接推定器を学習させることで、深層強化学習における価値関数および方策更新の分散を低減できるか?
  • RQ2報酬が確率的、スパars、またはノイズによって汚染されている場合、報酬推定は標準的な強化学習訓練と比較してどのように性能を発揮するか?
  • RQ3本手法は、MuJoCoの歩行制御のような連続的制御タスクにおいて、サンプル効率と最終パフォーマンスを維持または向上させるか?
  • RQ4生のサンプル報酬を使用する場合と比較して、ベルマンバックアップ演算子における分散低減の程度はどの程度か?
  • RQ5ガウス分布ノイズ、一様分布ノイズ、スパarsityなど、さまざまなタイプの報酬汚染に対して、報酬推定の利点は一貫しているか?

主な発見

  • 40%のスパarsityノイズを伴うHalfCheetah-v2では、推定報酬 $ \hat{R} $ の分散が29.989に低下した一方、破損報酬 $ R_{corr} $ の分散は163.790に留まり、顕著な分散低減が確認された。
  • 95%のスパarsityノイズ下では、Hopper-v2における $ \hat{R} $ の分散は4.146にまで低下し、$ R_{corr} $ の72.268から著しく減少した。これは極端な汚染下でもロバストであることを示している。
  • 標準偏差 $ \sigma = 0.4 $ のガウスノイズ下では、Reacher-v2における $ \hat{R} $ の分散は1.481に、$ R_{corr} $ は13.629にまで上昇した。これにより、一貫した分散低減が確認された。
  • 推定報酬 $ \hat{R} $ と真の報酬 $ R_{true} $ の間の平均二乗誤差(MSE)は、$ R_{corr} $ と $ R_{true} $ の間のMSEよりも常に低く、推定器の精度が裏付けられた。
  • すべての環境において、$ \hat{R} $ の使用により、MuJoCoおよびAtariベンチマークで収束が速くなり、最終パフォーマンスが向上した。TD誤差は低減され、学習曲線はより安定した。
  • 本手法は、下流の強化学習アルゴリズムの変更なしに顕著なパフォーマンス向上を達成したため、広範な互換性と実用的価値が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。