Skip to main content
QUICK REVIEW

[論文レビュー] Can Increasing Input Dimensionality Improve Deep Reinforcement Learning?

Kei Ota, Tomoaki Oiki|arXiv (Cornell University)|Mar 3, 2020
Reinforcement Learning in Robotics参考文献 26被引用数 15
ひとこと要約

本論文では、将来の観測を予測する自己教師付き補助タスクを通じて、低次元の観測から高次元状態表現を学習するオンライン特徴抽出ネットワークであるOFENetを提案する。一般的な常識とは対照的に、著者らは高次元表現が強化学習におけるサンプル効率と性能を顕著に向上させることを実証しており、特に適切な表現学習と組み合わせた場合、連続制御ベンチマークで最先端の手法を上回る結果を得ている。

ABSTRACT

Deep reinforcement learning (RL) algorithms have recently achieved remarkable successes in various sequential decision making tasks, leveraging advances in methods for training large deep networks. However, these methods usually require large amounts of training data, which is often a big problem for real-world applications. One natural question to ask is whether learning good representations for states and using larger networks helps in learning better policies. In this paper, we try to study if increasing input dimensionality helps improve performance and sample efficiency of model-free deep RL algorithms. To do so, we propose an online feature extractor network (OFENet) that uses neural nets to produce good representations to be used as inputs to deep RL algorithms. Even though the high dimensionality of input is usually supposed to make learning of RL agents more difficult, we show that the RL agents in fact learn more efficiently with the high-dimensional representation than with the lower-dimensional state observations. We believe that stronger feature propagation together with larger networks (and thus larger search space) allows RL agents to learn more complex functions of states and thus improves the sample efficiency. Through numerical experiments, we show that the proposed method outperforms several other state-of-the-art algorithms in terms of both sample efficiency and performance. Codes for the proposed method are available at http://www.merl.com/research/license/OFENet .

研究の動機と目的

  • 低次元状態表現がより良い強化学習性能をもたらすという一般的な信念に挑戦すること。
  • 学習された高次元特徴によって入力次元を増加させることで、深層強化学習におけるサンプル効率とポリシー性能が向上するかどうかを調査すること。
  • 下位の強化学習アルゴリズムのハイパーパrameterをチューニングせずに、効果的な特徴表現学習を可能にする手法を開発すること。
  • より大きな表現空間(深く広いネットワークによって可能)が、強化学習エージェントがより良いポリシーを発見するのを助けるかどうかを検討すること。
  • 意味のある高次元表現を学習するための補助タスクの影響を評価し、ポリシー学習を強化すること。

提案手法

  • 低次元観測と行動を高次元表現にマップするニューラルネットワークであるOFENetを提案し、MLP-DenseNetアーキテクチャを用いる。
  • OFENetを強化学習ポリシーと並行してオンラインで学習させるために、将来の観測を予測する自己教師付き補助タスクを用いる。
  • トレーニング中の特徴伝搬と勾配の流れを向上させるために、MLP-DenseNetに密なスキップ接続を採用する。
  • OFENetの全層からの出力を連結して、タスク関連の情報を保持する豊富な高次元表現を構築する。
  • 標準的な深層強化学習アルゴリズム(例:SAC)の入力としてOFENetの表現を統合し、ポリシーネットワークやハイパーパrameterを変更せずに利用する。
  • 同じ経験リプレイバッファを用いて、OFENetと強化学習エージェントをエンドツーエンドで同時に学習させ、表現とポリシーの共同最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1学習された高次元表現による入力次元の増加は、深層強化学習におけるサンプル効率を向上させるか?
  • RQ2将来の観測を予測する自己教師付き補助タスクは、ランダムまたは固定の表現よりも優れたポリシー学習をもたらすか?
  • RQ3高次元表現の利点は、表現学習プロセスの質に依存するものか、それとも次元そのもので十分か?
  • RQ4OFENet表現のサイズは、強化学習エージェントの性能と学習速度にどのように影響するか?
  • RQ5OFENetは、下位の強化学習アルゴリズムを変更せずに、多様な連続制御環境で性能を向上させることができるか?

主な発見

  • OFENetは、HalfCheetah-v2 や Ant-v2 といったベンチマーク連続制御タスクにおいて、サンプル効率と最終的性能の両面で、いくつかの最先端の深層強化学習アルゴリズムを上回っている。
  • SACのような下位の強化学習アルゴリズムをそのままであるにもかかわらず、優れた性能を達成しており、表現学習とポリシー学習を分離可能であることを示している。
  • OFENet表現の次元を4ユニットから128ユニットに増加させることで、HalfCheetah-v2 においてポリシー性能が単調に向上し、ある飽和点に達する。
  • 適切な表現学習なしにポリシーネットワークのパラメータ数を増やすだけ(same-paramsベースライン)では、OFENetの性能に達しないことから、モデルサイズよりも表現の質がより重要であることが示された。
  • トレーニング前にOFENetを凍結する(freeze-ofe)と、著しく性能が低下することが示され、強化学習ポリシーと共同でオンラインで学習させることが、効果的な表現学習に不可欠であることがわかった。
  • 将来の観測を予測する補助タスクは不可欠である—補助タスクなしでOFENetを学習する(no-aux)と、著しく性能が悪化するため、成功のためにはタスクに特化した表現学習が必要であることが証明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。