Skip to main content
QUICK REVIEW

[論文レビュー] Training Agents using Upside-Down Reinforcement Learning

Rupesh Kumar Srivastava, Pranav Shyam|arXiv (Cornell University)|Dec 5, 2019
Reinforcement Learning in Robotics参考文献 70被引用数 20
ひとこと要約

この論文では、報酬を最大化するのではなく、'Tステップで報酬Rを達成する'のような高レベルの命令に従うことを目的として、強化学習のフレームワークを再考したUpside-Down Reinforcement Learning (UDRL) を提案する。従来の強化学習の部品を一切用いずに、過去の軌道からヒューリスティックなデモを抽出し、命令から行動への写像を教師あり学習で学習する。この方法により、従来の強化学習のコンponentsを排除しながらも、エピソード的タスクで競争力のある性能を達成する。

ABSTRACT

We develop Upside-Down Reinforcement Learning (UDRL), a method for learning to act using only supervised learning techniques. Unlike traditional algorithms, UDRL does not use reward prediction or search for an optimal policy. Instead, it trains agents to follow commands such as "obtain so much total reward in so much time." Many of its general principles are outlined in a companion report; the goal of this paper is to develop a practical learning algorithm and show that this conceptually simple perspective on agent training can produce a range of rewarding behaviors for multiple episodic environments. Experiments show that on some tasks UDRL's performance can be surprisingly competitive with, and even exceed that of some traditional baseline algorithms developed over decades of research. Based on these results, we suggest that alternative approaches to expected reward maximization have an important role to play in training useful autonomous agents.

研究の動機と目的

  • 従来の強化学習の代替手段として、報酬最大化や非定常的目標を回避する実用的な手法の開発。
  • 過去の軌道を後向きに解釈したデモを用いて、命令に従う能力を学習可能にする。
  • 価値関数の近似や報酬予測なしに、命令-行動ペアに対する教師あり学習によって高報酬行動を生成できることの実証。
  • 命令ベースの学習が、サンプル効率や最終的性能において従来の強化学習ベースラインを凌駕または同等に達成できるかの探求。

提案手法

  • エージェントは、命令(例:'Tステップで合計報酬Rを達成する')を状態sと命令cの関数B(s, c)として行動にマッピングするように訓練される。
  • 過去の軌道は、命令の達成が成功したデモとして後から解釈され、教師あり学習の訓練データを形成する。
  • 軌道に含まれる観測された報酬と時間枠から命令が構築され、状態-行動ペアに対してヒューリスティックなラベル付けが可能になる。
  • 行動関数は標準的な教師あり学習の目的関数で訓練され、報酬予測や時系列差分学習は一切使用しない。
  • 実現可能性フィルタを用いて、達成可能性が高いと予想される命令を優先することで、学習の安定性を向上させる。
  • 従来の強化学習の部品(例:ターゲットネットワーク、価値ネットワーク、報酬形状づけ)を一切排除し、教師あり関数近似に依存する。

実験結果

リサーチクエスチョン

  • RQ1エピソード的環境において、報酬-行動ペアの教師あり学習のみで高報酬行動を学習できるか?
  • RQ2さまざまな命令(例:'TステップでRの報酬を達成する')に従うように学習させることで、従来の報酬最大化に比べて一般化性能が向上するか?
  • RQ3UDRLがベンチマークタスクにおいて、サンプル効率や最終的性能で従来の強化学習ベースラインを上回るか、同等に達するか?
  • RQ4報酬の遅延や学習後における命令仕様の変更に対し、この手法はどのように対処するか?
  • RQ5追加の安定化技術なしに、状態や命令の間で行動関数が効果的に一般化できるか?

主な発見

  • UDRLは、いくつかのエピソード的環境で予想に反して競争力のある性能を達成し、一部のケースでは従来の強化学習ベースラインを上回る。
  • 報酬の遅延がある環境でも、目的の報酬と時間枠を指定する命令に従う能力を効果的に学習している。
  • UDRLで訓練されたエージェントは、再訓練なしに学習後、新しい命令に適応して行動を変更でき、命令解釈の柔軟性を示している。
  • 行動関数は状態や命令の間で良好に一般化しており、ターゲットネットワークや価値関数安定化の追加技術なしに、ニューラルネットワークのような強力な関数近似器を効果的に使用できることを示唆している。
  • 実験により、この手法は、過去の軌道を特定の命令ターゲットに対して成功とみなしてラベル付けすることで、自然に遅延報酬に対処できることを示している。
  • このアプローチにより、十分な確率的要因がある低次元の行動空間において、探索を支援するサンプル効率の高い学習が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。