Skip to main content
QUICK REVIEW

[論文レビュー] Evolving Rewards to Automate Reinforcement Learning

Aleksandra Faust, Anthony Francis|arXiv (Cornell University)|May 18, 2019
Reinforcement Learning in Robotics参考文献 26被引用数 22
ひとこと要約

本稿では、報酬チューニングをハイパーパramータ最適化として扱うことで報酬工学の自動化を図る、AutoRLと呼ばれる進化的強化学習フレームワークを提案する。報酬関数のパラメータ化された関数の集団ベース探索を用いてプロキシ報酬を進化させることで、SACを用いたHumanoidにおいて、手動でチューニングされたおよびハイパーパramータチューニングされたベースラインと比較して、最大489%の性能向上を達成した。

ABSTRACT

Many continuous control tasks have easily formulated objectives, yet using them directly as a reward in reinforcement learning (RL) leads to suboptimal policies. Therefore, many classical control tasks guide RL training using complex rewards, which require tedious hand-tuning. We automate the reward search with AutoRL, an evolutionary layer over standard RL that treats reward tuning as hyperparameter optimization and trains a population of RL agents to find a reward that maximizes the task objective. AutoRL, evaluated on four Mujoco continuous control tasks over two RL algorithms, shows improvements over baselines, with the the biggest uplift for more complex tasks. The video can be found at: \url{https://youtu.be/svdaOFfQyC8}.

研究の動機と目的

  • 連続的制御タスクにおける報酬形状の面倒なプロセスを自動化すること。現在は広範な手動チューニングを要している。
  • 高次元制御におけるサンプル効率の学習を妨げる、疎なまたは poorly 構造化された報酬の課題に対処すること。
  • 手動で設計された多目的報酬に依存するのを減らし、自動最適化によって効果的なプロキシ報酬を発見すること。
  • 進化的報酬探索が、多様な強化学習アルゴリズムとタスクにおいて、従来のハイパーパramータチューニングや手動報酬工学を上回るかを評価すること。
  • 単一タスクの目的(例:移動距離)を最適化することにより、複雑な標準報酬を用いて訓練されたポリシーと同等の性能を示すポリシーが得られるかを実証すること。

提案手法

  • 報酬重みを最適化すべきハイパーパラメータとして扱い、パラメータ化された報酬関数の探索に進化的アルゴリズム(EA)を適用する。
  • パラメータ化された標準環境報酬の異なるバージョンを用いた、報酬設定が異なる複数の強化学習エージェントを並列で訓練する。
  • タスクの目的(例:移動距離、到達高さ)または標準報酬をフィットネス信号として用い、最も優れた報酬設定を選別する。
  • 突然変異や選択といった進化的戦略を用いて報酬パラメータを最適化し、エージェントの性能に基づいて報酬関数を段階的に改善する。
  • 進化した報酬を標準強化学習アルゴリズム(SACおよびPPO)に統合し、手動チューニングおよびハイパーパラメータチューニングされたベースラインと、エンドツーエンドで比較可能にする。
  • タスク目的と標準報酬に基づいて訓練されたポリシー間のクロス評価を実施し、一般化性能と性能の同等性を評価する。

実験結果

リサーチクエスチョン

  • RQ1報酬設計の自動化された進化的アプローチは、連続的制御タスクにおいて、手動報酬形状やハイパーパラメータチューニングを上回ることができるか?
  • RQ2単一タスクの目的(例:移動距離)を最適化することで、複雑な多目的標準報酬を用いて訓練されたポリシーと同等の性能を示すポリシーが得られるか?
  • RQ3AutoRLの報酬探索は、サンプル効率および最終的なポリシー性能の観点で、従来のハイパーパラメータチューニングと比べてどのように異なるか?
  • RQ4AutoRLは、異なる強化学習アルゴリズム(SAC 対 PPO)および環境(Ant, Walker2D, HumanoidStandup, Humanoid)に一般化可能か?
  • RQ5同じ学習予算のもとで、進化した報酬はベースライン手法よりも収束が速く、より高品質なポリシーを生成するか?

主な発見

  • SACを用いて単一タスクの目的(移動距離)を最適化した場合、Humanoidタスクにおいてハイパラメータチューニングのベースラインを489%も上回る性能向上を達成した。
  • 単一タスクの目的に基づいて訓練されたAutoRLポリシーは、標準の多目的報酬を用いて訓練されたポリシーと同等の性能を示し、複雑な報酬工学の必要性を低減した。
  • AutoRLは、4つのMujoco環境すべてにおいて、手動チューニングおよびハイパラメータチューニングされたベースラインを上回った。特に、より複雑なタスクで最大の向上を示した。
  • SACでは、AutoRLが最も速く、最も安定した学習を達成し、平均報酬が高く、行動の一貫性もPPOベースのベースラインを上回った。
  • HumanoidStandupでは、SACを用いたAutoRLが唯一、完全に立ち上がることに成功したのに対し、他の手法は一貫したしゃがみ姿勢に留まった。これは、より優れたポリシー品質を示している。
  • クロス評価の結果、タスク目的に基づいて最適化されたポリシーは、標準報酬評価においても良好に一般化された。これは、単一の目的が複雑な報酬関数を効果的に代理できる可能性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。