Skip to main content
QUICK REVIEW

[論文レビュー] FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback

Baicen Xiao, Qifan Lu|arXiv (Cornell University)|Jan 19, 2020
Reinforcement Learning in Robotics参考文献 46被引用数 13
ひとこと要約

FRESHは、高次元状態空間における深層強化学習に人間のフィードバックを統合するフィードバックベースの報酬形状化フレームワークを導入し、アンサンブル不確実性推定を備えたフィードバックニューラルネットワークを用いて、人間がラベル付けした状態行動ペアの質を未観測の軌道へ一般化する。ボウリングでは人間の専門家より21.4%高いスコアを達成し、スキーイングでは専門家の性能に達しており、最先端の深層強化学習アルゴリズムを上回る。

ABSTRACT

Reinforcement learning has been successful in training autonomous agents to accomplish goals in complex environments. Although this has been adapted to multiple settings, including robotics and computer games, human players often find it easier to obtain higher rewards in some environments than reinforcement learning algorithms. This is especially true of high-dimensional state spaces where the reward obtained by the agent is sparse or extremely delayed. In this paper, we seek to effectively integrate feedback signals supplied by a human operator with deep reinforcement learning algorithms in high-dimensional state spaces. We call this FRESH (Feedback-based REward SHaping). During training, a human operator is presented with trajectories from a replay buffer and then provides feedback on states and actions in the trajectory. In order to generalize feedback signals provided by the human operator to previously unseen states and actions at test-time, we use a feedback neural network. We use an ensemble of neural networks with a shared network architecture to represent model uncertainty and the confidence of the neural network in its output. The output of the feedback neural network is converted to a shaping reward that is augmented to the reward provided by the environment. We evaluate our approach on the Bowling and Skiing Atari games in the arcade learning environment. Although human experts have been able to achieve high scores in these environments, state-of-the-art deep learning algorithms perform poorly. We observe that FRESH is able to achieve much higher scores than state-of-the-art deep learning algorithms in both environments. FRESH also achieves a 21.4% higher score than a human expert in Bowling and does as well as a human expert in Skiing.

研究の動機と目的

  • 高次元状態空間における報酬の疎らさと遅延の課題に対処すること。深層強化学習エージェントは人間の熟練にもかかわらず、困難を抱える。
  • 専門家のデモンストレーションや複雑な好みのモデリングを必要とせず、人間のフィードバックを深層強化学習に効果的に統合すること。
  • テスト時の未観測状態および行動へ、人間が提供した状態と行動のフィードバックを、不確実性推定を伴うニューラルネットワークを用いて一般化すること。
  • 人間が参加するフィードバックを用いて報酬を形状化することで、アタリゲームのような複雑な環境におけるサンプル効率と最終的性能を向上させること。
  • 人間のフィードバックが、特定の高次元制御タスクにおいて、最先端の強化学習エージェントおよび人間の専門家を上回る性能を達成できるかどうかを示すこと。

提案手法

  • 人間のオペレータがリプレイバッファから得た軌道をレビューし、各状態行動ペアを「良い」「悪い」「判断できない」とラベル付ける。
  • フィードバックはフィードバックバッファに保存され、未観測の状態行動ペアの質を予測するための深層フィードバックニューラルネットワークの学習に使用される。
  • 同じアーキテクチャを持つニューラルネットワークのアンサンブルを用いて、予測の不確実性と信頼性を推定する。
  • フィードバックネットワークの出力を、環境が提供する報酬に加算する形状報酬信号に変換する。
  • 組み合わせ報酬(環境報酬 + 形状報酬)を用いて、DQN や SAC などのオフポリシー手法により深層強化学習エージェントを学習させる。
  • トレーニング中にフィードバックネットワークをファインチューニングし、不確実性推定値を用いて曖昧または不確実な状態のフィードバックを優先する。

実験結果

リサーチクエスチョン

  • RQ1人間のフィードバックが、高次元状態空間における深層強化学習エージェントのサンプル効率と最終的性能を著しく向上させることができるか?
  • RQ2非専門家の人間オペレータからのフィードバックを、深層ニューラルネットワークを用いて未観測状態および行動へ効果的に一般化できるか?
  • RQ3フィードバックベースの報酬形状化は、人間プレーヤーが優れた性能を発揮する環境で、最先端の深層強化学習アルゴリズムを上回ることができるか?
  • RQ4人間のフィードバックが、複雑なビデオゲーム環境において、人間の専門家を上回る性能を達成するまでの程度はどの程度か?
  • RQ5ニューラルアンサンブル手法によるモデルの不確実性推定は、フィードバックベースの報酬形状化のロバスト性と信頼性をどのように向上させるか?

主な発見

  • FRESHはボウリング環境で平均187のスコアを達成し、人間の専門家ベースライン比で21.4%の向上を示した。
  • FRESHがボウリングで達成した最高スコアは200を超えており、このタスクにおいて人間の能力を超える強力な性能を示した。
  • スキーイング環境では、FRESHは平均スコア-4400を達成し、人間の専門家プレーヤーと同等の性能を示した。
  • FRESHはボウリングおよびスキーイングの両環境で、最先端の深層強化学習アルゴリズムを著しく上回り、人間が参加する報酬形状化の有効性を示した。
  • アンサンブルフィードバックネットワークの使用により、一般化性能と信頼性推定が向上し、状態空間の低フィードバック領域でも信頼できる形状報酬を提供できた。
  • フレームワークは、軌道に対する人間のフィードバックを効果的に報酬形状化に活用し、環境との相互作用を大幅に削減し、学習効率を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。