Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning with Supervision from Noisy Demonstrations

Kun-Peng Ning, Sheng-Jun Huang|arXiv (Cornell University)|Jun 14, 2020
Reinforcement Learning in Robotics参考文献 21被引用数 7
ひとこと要約

本稿では、各示範例の潜在的有用性を推定することで、ノイズの多い専門家の示範を動的に重み付けする仕組みを備えた強化学習フレームワーク、LfNDを提案する。価値関数の利益を重み付け信号として用い、ポリシー勾配と重み付き交差エントロピー損失を組み合わせることで、サンプル効率とロバスト性が向上し、高ノイズ比下でも少ない訓練反復回数で高い性能を達成する。

ABSTRACT

Reinforcement learning has achieved great success in various applications. To learn an effective policy for the agent, it usually requires a huge amount of data by interacting with the environment, which could be computational costly and time consuming. To overcome this challenge, the framework called Reinforcement Learning with Expert Demonstrations (RLED) was proposed to exploit the supervision from expert demonstrations. Although the RLED methods can reduce the number of learning iterations, they usually assume the demonstrations are perfect, and thus may be seriously misled by the noisy demonstrations in real applications. In this paper, we propose a novel framework to adaptively learn the policy by jointly interacting with the environment and exploiting the expert demonstrations. Specifically, for each step of the demonstration trajectory, we form an instance, and define a joint loss function to simultaneously maximize the expected reward and minimize the difference between agent behaviors and demonstrations. Most importantly, by calculating the expected gain of the value function, we assign each instance with a weight to estimate its potential utility, and thus can emphasize the more helpful demonstrations while filter out noisy ones. Experimental results in various environments with multiple popular reinforcement learning algorithms show that the proposed approach can learn robustly with noisy demonstrations, and achieve higher performance in fewer iterations.

研究の動機と目的

  • 現実の応用では不切実な仮定である完璧な専門家の示範を仮定する既存のRLED手法の限界を是正すること。
  • ノイズ混じりまたは不完全な専門家の示範を効果的に活用することで、強化学習におけるサンプル効率を向上させること。
  • 高品質な示範例を適応的に特定・強調し、ノイズ混じりまたは誤解を招くものとはフィルタリングする手法を開発すること。
  • 環境との相互作用と示範の活用を統合的・統合的な学習フレームワークとして統合すること。

提案手法

  • 各示範軌道のステップを、個別監視のためのインスタンス(状態、行動、報酬)として定式化する。
  • 期待報酬を最大化するためのポリシー勾配と、エージェントの行動を示範と一致させるための交差エントロピー損失を組み合わせた共同損失関数を定義する。
  • 各インスタンスの潜在的有用性を推定するために、専門家Q値Q_E(s,a)とエージェントの状態価値V_π(s)の差分として、価値関数の期待利益を計算する。
  • この期待利益に基づき、動的重みを各インスタンスに割り当て、有用性の高い示範を強調し、ノイズ混じりまたは誤解を招くものを軽減する。
  • すべてのインスタンスについて重み付き共同損失を最小化することで、ポリシー学習と示範活用を同時に最適化する。
  • さまざまな環境で複数のRLアルゴリズム(例:TRPO、PPO)を用いてフレームワークを実装し、ロバスト性と汎用性を検証する。

実験結果

リサーチクエスチョン

  • RQ1完璧な示範が得られない状況下で、強化学習エージェントはノイズ混じりの専門家の示範から効果的に学習できるか?
  • RQ2個々の示範インスタンスの有用性をどのように推定すれば、高品質な示範とノイズ混じりの示範を区別できるか?
  • RQ3価値関数の利益に基づく適応的重み付けは、ノイズ混じりの示範が存在する状況下で、サンプル効率と最終的なポリシー性能を向上させるか?
  • RQ4さまざまなノイズレベル下で、提案手法は標準的なRLおよび状態生成学習のベースラインと比較してどのように差をつけるか?

主な発見

  • LfNDは、全テスト環境において平均および最大累積報酬の両面で、標準的なRLアルゴリズム(TRPO、PPO)および状態生成学習ベースラインを一貫して上回る性能を示した。
  • ノイズ比が0から1に増加するに従い、LfNDと他の手法との性能差が拡大する傾向にあり、ノイズ混じりの示範に対して優れたロバスト性を示した。
  • 価値関数の利益によって推定された平均重みが高かった示範は、顕著に優れた状態生成学習性能を達成しており、有用性推定の正確性が裏付けられた。
  • 異なる重み付け戦略のうち、対数形および線形形(LfND-log、LfND-linear10/20)がワンゼロベースラインを上回り、適応的重み付けの有効性を確認した。
  • 特に示範ノイズ比が高い環境では、高い性能に到達するための訓練反復回数が削減された。
  • 提案された重み付け機構は、誤解を招く示範を効果的にフィルタリングし、ポリシー向上に最も寄与する示範を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。