Skip to main content
QUICK REVIEW

[論文レビュー] Improving Generalization in Meta Reinforcement Learning using Neural Objectives

Louis Kirsch, Sjoerd van Steenkiste|arXiv (Cornell University)|Apr 30, 2020
Reinforcement Learning in Robotics参考文献 41被引用数 14
ひとこと要約

MetaGenRL は、多様なエージェントからの経験を低複雑性のニューラル目的関数に凝縮するメタ強化学習アルゴリズムであり、未学習環境への強力な一般化を可能にする。オフポリシーの2次勾配を用いることで高いサンプル効率を達成し、未学習環境において標準的なメタRL手法や一部の人間が設計したRLアルゴリズムを上回る性能を発揮する。

ABSTRACT

Biological evolution has distilled the experiences of many learners into the general learning algorithms of humans. Our novel meta-reinforcement learning algorithm MetaGenRL is inspired by this process. MetaGenRL distills the experiences of many complex agents to meta-learn a low-complexity neural objective function that affects how future individuals will learn. Unlike recent meta-RL algorithms, MetaGenRL can generalize to new environments that are entirely different from those used for meta-training. In some cases, it even outperforms human-engineered RL algorithms. MetaGenRL uses off-policy second-order gradients during meta-training that greatly increase its sample efficiency.

研究の動機と目的

  • メタトレーニング中に観測しなかった環境に対しても、効果的に一般化できるメタRLアルゴリズムの開発を目的とする。
  • 複数のエージェントからの経験を統合し、共通の低複雑性ニューラル目的関数に凝縮することで、生物学的進化を模倣する。
  • オフポリシーの2次勾配更新を用いることで、メタトレーニングにおけるサンプル効率を向上させる。
  • 一般化可能な目的関数を学習することで、将来のエージェントがより効果的に学習できるようにすることを目的とする。

提案手法

  • MetaGenRL は、メタトレーニング中に複数の複雑なエージェントの経験を凝縮することで、ニューラル目的関数を学習する。
  • アルゴリズムはオフポリシーのデータを用いて2次勾配を計算し、メタ最適化中のサンプル効率を向上させる。
  • 学習されたニューラル目的関数は、将来のエージェントの学習プロセスをガイドし、その方策更新を形作る。
  • 目的関数はメタ勾配降下を用いて最適化され、多様な環境間での一般化を可能にする。
  • この手法により、メタトレーニング環境と構造的・動的にも異なる環境へのトランスファーが可能になる。

実験結果

リサーチクエスチョン

  • RQ1メタRLアルゴリズムは、メタトレーニング中に見られなかった環境に対しても一般化できるか?
  • RQ2多様なエージェントから学習したニューラル目的関数は、強化学習における一般化を向上させることができるか?
  • RQ3メタトレーニングに2次勾配のオフポリシー学習を用いることで、サンプル効率と性能が向上するか?
  • RQ4凝縮されたニューラル目的関数は、新しい環境において手作業で設計された報酬関数を上回ることができるか?

主な発見

  • MetaGenRL は、メタトレーニングに使用された環境とはまったく異なる新しい環境に対しても一般化できる。
  • アルゴリズムは、以前に未観測だった環境において、一部の人間が設計した強化学習アルゴリズムを上回る性能を発揮する。
  • オフポリシーの2次勾配の使用は、メタトレーニング中のサンプル効率を顕著に向上させる。
  • 凝縮されたニューラル目的関数は、多様な環境間での効果的な学習転送を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。