Skip to main content
QUICK REVIEW

[論文レビュー] Reward Uncertainty for Exploration in Preference-based Reinforcement Learning

Xinran Liang, Katherine Lin Shu|arXiv (Cornell University)|May 24, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本論文では、人間のフィードバックが高価で限られているPreference-based Reinforcement Learning(RL)における内発的探索ボーナスとして、RUNE(Reward Uncertainty for Exploration)を提案する。RUNEは、学習済みの報酬モデルのアンサンブルにおける不確実性を活用し、探索をガイドする。報酬モデル間の合意のなさ(不一致)をフィードバックの不確実性の代理として測定することで、MetaWorldのロボット操作タスクにおいて、状態訪問頻度の新規性に依存する最先端の手法を上回る、より高いサンプル効率およびフィードバック効率を達成する。

ABSTRACT

Conveying complex objectives to reinforcement learning (RL) agents often requires meticulous reward engineering. Preference-based RL methods are able to learn a more flexible reward model based on human preferences by actively incorporating human feedback, i.e. teacher's preferences between two clips of behaviors. However, poor feedback-efficiency still remains a problem in current preference-based RL algorithms, as tailored human feedback is very expensive. To handle this issue, previous methods have mainly focused on improving query selection and policy initialization. At the same time, recent exploration methods have proven to be a recipe for improving sample-efficiency in RL. We present an exploration method specifically for preference-based RL algorithms. Our main idea is to design an intrinsic reward by measuring the novelty based on learned reward. Specifically, we utilize disagreement across ensemble of learned reward models. Our intuition is that disagreement in learned reward model reflects uncertainty in tailored human feedback and could be useful for exploration. Our experiments show that exploration bonus from uncertainty in learned reward improves both feedback- and sample-efficiency of preference-based RL algorithms on complex robot manipulation tasks from MetaWorld benchmarks, compared with other existing exploration methods that measure the novelty of state visitation.

研究の動機と目的

  • 人間のフィードバックが高価で限られているPreference-based Reinforcement Learningにおけるフィードバック効率およびサンプル効率の向上を図ること。
  • 標準的なRLでは成功が証明されているが、Preference-based RLには適した探索手法が不足しているという問題に取り組むこと。
  • 人間のフィードバックから得られる学習済み報酬関数の不確実性が、探索のための意味のある内発的報酬として機能するかを検証すること。
  • 報酬予測の不確実性を活用することで、探索を人間の好みに合わせること。

提案手法

  • RUNEは、人間のフィードバックに基づいて学習された複数の報酬モデル(アンサンブル)を用い、報酬予測の不確実性を推定する。
  • 内発的探索ボーナスは、アンサンブルが予測する報酬の標準偏差として計算される。
  • この不確実性信号は、人間のフィードバックの曖昧さを反映し、フィードバックが不確実な領域へ探索を誘導する。
  • 学習における総報酬は、外的環境報酬、アンサンブルの予測平均、および内発的不確実性ボーナスの合計で構成される。
  • 本手法は、既存のPreference-based RLアルゴリズムと互換性があり、報酬モデルのアンサンブル学習を除いて、アーキテクチャの変更は不要である。
  • 探索は、状態訪問頻度ではなく報酬の不確実性に基づいて行われるため、人間の好みと整合性を持つ。

実験結果

リサーチクエスチョン

  • RQ1学習済み報酬関数の不確実性は、Preference-based RLにおける効果的な内発的報酬として機能するか?
  • RQ2報酬の不確実性を用いることで、Preference-based RLにおける最先端の探索手法と比較して、フィードバック効率およびサンプル効率が向上するか?
  • RQ3異なる人間のフィードバッククエリ数やアンサンブルサイズに対して、本手法はどれほど頑健か?
  • RQ4報酬の不確実性に基づく内発的ボーナスは、真の報酬関数への収束を早めるか?
  • RQ5限られた人間入力が想定される実世界応用に適した、低フィードバック予算下でも性能を維持できるか?

主な発見

  • RUNEはMetaWorldタスクにおいてサンプル効率を向上させ、PEBBLEや他のベースラインと比較して、より少ない環境インタラクションで高い成功確率を達成した。
  • フィードバック予算を80%削減しても、RUNEは優れた性能を維持するが、PEBBLEベースラインは漸近的成績が著しく低下した。
  • RUNEで学習された報酬関数は、EPIC距離で測定したところ、真の報酬に早く収束し、より近い位置に到達した。これは、報酬の整合性が高まっていることを示している。
  • アンサンブルサイズ(3, 5, 7)にかかわらず、安定した性能を発揮し、サンプル効率に劣化が生じなかった。
  • 報酬の不確実性に基づく内発的ボーナスは、人間の好みと整合するより効果的な探索を実現し、ポリシー学習の加速とフィードバック効率の向上が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。