Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning with Perturbed Rewards

Jingkang Wang, Yang Liu|arXiv (Cornell University)|Oct 2, 2018
Reinforcement Learning in Robotics参考文献 48被引用数 15
ひとこと要約

本論文では、学習可能な誤り行列を用いて摂動を加えた報酬からバイアスのないサーミュレート報酬を推定する、頑健な強化学習フレームワークを提案する。この手法により、真の報酬分布についての事前知識がなくても、ノイズの多い環境でも効果的な学習が可能になる。本手法は最先端の性能を達成し、PPOを用いた5つのAtariゲームにおいて、10%および30%のノイズ率の下で平均スコアをそれぞれ84.6%および80.8%向上させた。

ABSTRACT

Recent studies have shown that reinforcement learning (RL) models are vulnerable in various noisy scenarios. For instance, the observed reward channel is often subject to noise in practice (e.g., when rewards are collected through sensors), and is therefore not credible. In addition, for applications such as robotics, a deep reinforcement learning (DRL) algorithm can be manipulated to produce arbitrary errors by receiving corrupted rewards. In this paper, we consider noisy RL problems with perturbed rewards, which can be approximated with a confusion matrix. We develop a robust RL framework that enables agents to learn in noisy environments where only perturbed rewards are observed. Our solution framework builds on existing RL/DRL algorithms and firstly addresses the biased noisy reward setting without any assumptions on the true distribution (e.g., zero-mean Gaussian noise as made in previous works). The core ideas of our solution include estimating a reward confusion matrix and defining a set of unbiased surrogate rewards. We prove the convergence and sample complexity of our approach. Extensive experiments on different DRL platforms show that trained policies based on our estimated surrogate reward can achieve higher expected rewards, and converge faster than existing baselines. For instance, the state-of-the-art PPO algorithm is able to obtain 84.6% and 80.8% improvements on average score for five Atari games, with error rates as 10% and 30% respectively.

研究の動機と目的

  • センサーノイズ、人間のフィードバックのばらつき、または悪意ある操作によって、観測可能な報酬がノイズの多い状態にある場合に、強化学習エージェントを訓練するという課題に対処すること。
  • 真の報酬分布やノイズモデルに関する仮定を、報酬誤り行列を除いて一切不要とする手法を開発すること。
  • 観測された摂動を加えた報酬から導出されるバイアスのないサーミュレート報酬を用いて、最適方策への収束を可能とすること。
  • 提案された頑健なRLアプローチの理論的収束性およびサンプル複雑度を分析すること。
  • 異なる環境(AtariゲームやOpenAI Gym環境など)において、本手法の頑健性と性能向上を実験的に検証すること。

提案手法

  • 本手法は、真の報酬が決定的であると仮定し、観測された摂動を加えた報酬から、効率的で柔軟な推定モジュールを用いて報酬誤り行列を推定する。
  • 推定された誤り行列を逆行列化することで、真の報酬にアクセスしているかのように学習できるバイアスのないサーミュレート報酬を構築する。
  • PPO、DQN、SACなどの既存のDRLアルゴリズムのコアな訓練手順を変更せずに、本フレームワークを統合可能である。
  • 2段階の学習プロセスを採用する:まず、ロールアウトから誤り行列を推定し、次に推定されたサーミュレート報酬を用いて方策最適化を行う。
  • 理論的分析により、サーミュレート報酬設定下でのQ学習における収束性と有限サンプル複雑度を証明した。
  • 高ノイズ環境下でのサンプル効率を向上させるために、分散低減技術(VRT)を適用した。

実験結果

リサーチクエスチョン

  • RQ1真の報酬分布に関する事前知識がなくても、摂動を加えた報酬からバイアスのないサーミュレート報酬を推定できるか?
  • RQ2標準的なRLが失敗する高ノイズ率(例:30%または70%)の環境下で、本手法はどのように性能を発揮するか?
  • RQ3サーミュレート報酬の使用により、ベースラインと比較して収束が速くなり、期待累積報酬が高くなるか?
  • RQ4真の行列が未知であっても、誤り行列推定モジュールは実際のところ、速く正確に収束するか?
  • RQ5ノイズ除去プロセスが、意図しないが有益な探索を誘発し、真の報酬ベースラインを上回る性能向上をもたらすことはないか?

主な発見

  • PPOを用いた5つのAtariゲームにおいて、10%および30%のノイズ率下で、標準的なRLに比べて平均スコアをそれぞれ84.6%および80.8%向上させた。
  • CartPoleでは、真の報酬ベースラインおよび分散低減技術と比較して、高ノイズ環境(例:70%ノイズ率)下で、本手法が182.3の平均リターンを達成した。
  • 誤り行列推定は急速に収束し、ほとんどの設定で10,000ステップ以内に推定値と真値の差の絶対値が0.05未満に低下した。
  • 一部の環境では、真の報酬ベースラインを上回る性能を発揮した。これは、ノイズ除去と探索の組み合わせが学習を強化している可能性を示唆している。
  • 本手法は、PPO、DQN、SAC、DDPGといった多様なDRLアルゴリズムおよび対称的・非対称的なノイズタイプにおいて、頑健な性能を維持しており、広範な適用可能性を示した。
  • サーミュレート報酬と分散低減技術(VRT)の統合により、特に高ノイズ環境下でサンプル効率がさらに向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。