Skip to main content
QUICK REVIEW

[論文レビュー] Meta-learning curiosity algorithms

Ferran Alet, Martin F. Schneider|arXiv (Cornell University)|Mar 11, 2020
Reinforcement Learning in Robotics参考文献 59被引用数 16
ひとこと要約

この論文は、ニューラルネットワークの重みを転送するのではなく、プログラム可能な好奇心アルゴリズムの豊かな空間を探索する、新しいメタラーニングアプローチを提案している。このアプローチにより、画像ベースのグリッドワールド、Ant、Hopper、Lunar Landerなど多様な環境で、人間が設計した手法と同等またはそれを上回る2つの新しい好奇心アルゴリズムが発見され、類似したタスクを超えたメタRLにおける広範な一般化を示している。

ABSTRACT

We hypothesize that curiosity is a mechanism found by evolution that encourages meaningful exploration early in an agent's life in order to expose it to experiences that enable it to obtain high rewards over the course of its lifetime. We formulate the problem of generating curious behavior as one of meta-learning: an outer loop will search over a space of curiosity mechanisms that dynamically adapt the agent's reward signal, and an inner loop will perform standard reinforcement learning using the adapted reward signal. However, current meta-RL methods based on transferring neural network weights have only generalized between very similar tasks. To broaden the generalization, we instead propose to meta-learn algorithms: pieces of code similar to those designed by humans in ML papers. Our rich language of programs combines neural networks with other building blocks such as buffers, nearest-neighbor modules and custom loss functions. We demonstrate the effectiveness of the approach empirically, finding two novel curiosity algorithms that perform on par or better than human-designed published curiosity algorithms in domains as disparate as grid navigation with image inputs, acrobot, lunar lander, ant and hopper.

研究の動機と目的

  • 現在のメタRL手法が、著しく異なる環境間で一般化がうまくいかないという制限を克服するため、好奇心をアルゴリズムの空間におけるメタラーニングとして定式化すること。
  • 状態空間や行動空間が異なる環境(例えば、画像ベースのタスクやロボット制御タスクなど)において一般化を可能にするため、ネットワーク重みの学習にとどまらず、完全なプログラムの学習を可能にすること。
  • ニューラルネットワーク、最近傍探索モジュール、カスタム損失関数などのプログラムコンポーネントの組み合わせ空間において自動探索を行い、新しい効果的な好奇心メカニズムを発見すること。
  • プログラム構造からの性能予測と学習曲線の監視に基づく早期停止を用いて、有望でないプログラムの完全な訓練を回避することで、計算コストの高いメタラーニングプロセスを効率化すること。
  • メタラーニングで得られたプログラムが、多様で複雑な環境において、人間が設計したベースラインを同等または上回る好奇心アルゴリズムを生み出せることを実証すること。

提案手法

  • 本手法は二重ループフレームワークを用いる:外側のループでドメイン固有の言語(DSL)を用いたプログラム空間における進化的探索により好奇心モジュールを生成し、内側のループで動的に適応する報酬信号を用いて標準的な強化学習を実行する。
  • DSLは、勾配降下を伴うニューラルネットワーク、学習された目的関数、アンサンブル、バッファ、カスタム損失関数を含む複雑なプログラム構造をサポートしており、多様な探索戦略の表現を可能にしている。
  • 探索プロセスでは、プログラム構造からの性能予測と学習曲線の監視に基づく早期停止を用い、有望でない候補の完全な訓練を回避する。
  • 候補プログラムは、単純で短いホライズンのタスクから始めて、環境の分布全体で評価され、効果のないアルゴリズムを早期に除外する。
  • 最終的な好奇心モジュールは、各時刻ステップで疑似報酬 $\widehat{r}$ を計算し、エージェントの内的動機づけを形作り、探索を誘導する。
  • 多態性のデータ型を用いることで、環境に応じてネットワークアーキテクチャ(例えば、CNN対MLP)が自動的に適応するため、入力モodalが異なる環境(例:ピクセル対関節状態)間での一般化が可能になる。

実験結果

リサーチクエスチョン

  • RQ1非常に異なる状態空間や行動空間を持つ環境間で、豊かなプログラム的好奇心アルゴリズムの空間におけるメタラーニングが一般化可能か?
  • RQ2自動的に発見された好奇心アルゴリズムが、多様なRLベンチマークにおいて、人間が設計した内在的報酬メカニズムを上回るか同等の性能を示せるか?
  • RQ3プログラム構造からの予測と学習曲線の監視に基づく早期 pruning が、組み合わせ的プログラム空間におけるメタRLの計算コストを顕著に削減できるか?
  • RQ4ニューラルネットワーク、バッファ、カスタム損失関数を含むメタラーニングされたプログラムが、文献に既に提案されていない新しい効果的な探索戦略を発見できるか?
  • RQ5根本的に異なるタスク間での一般化という観点から、プログラムのメタラーニングは重みのメタラーニングに比べて優れているか?

主な発見

  • 提案手法により、画像ベースのグリッドナビゲーション、Acrobot、Lunar Lander、Ant、Hopperなど多様な環境で、人間が設計した好奇心アルゴリズムと同等またはそれを上回る2つの新しい好奇心アルゴリズムが発見された。
  • 最良の性能を示した好奇心アルゴリズムは、異なる入力空間(例:ピクセル対関節角度)および出力空間を持つ環境間で一般化でき、類似したタスクを超えた広範な転送を示した。
  • 標準的な好奇心手法が苦手とする、長ホライズンかつ高変動性の設定でも、効果的な探索と高い報酬を達成した。
  • 性能予測と学習曲線の監視に基づく早期 pruning により、有望でないプログラムの完全な訓練を回避し、計算時間を大幅に削減した。
  • 異なる迷路や勾配の変化といった小さなタスク変化での一般化にとどまる従来のメタRL手法とは異なり、根本的に異なる環境間での一般化を実現した。
  • 発見されたアルゴリズムは解釈可能であり、ニューラルネットワークや最近傍探索モジュールなどのモジュラー構成要素から構成されており、さらなる分析や適合の可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。