Skip to main content
QUICK REVIEW

[論文レビュー] Discovery of Options via Meta-Learned Subgoals

Vivek Veeriah, Tom Zahavy|arXiv (Cornell University)|Feb 12, 2021
Reinforcement Learning in Robotics参考文献 48被引用数 5
ひとこと要約

本論文では、メタ勾配を用いて複数のタスクにまたがるタスクに依存しないオプションを発見するためのMODACを提案する。この手法は、メタ最適化により部分目標を定義するオプション報酬関数と終了条件を学習することで、複数のタスクにわたる共同最適化を通じて再利用可能で多様なオプションを特定し、より速い学習と未学習タスクへのより優れた転移を実現する。

ABSTRACT

Temporal abstractions in the form of options have been shown to help reinforcement learning (RL) agents learn faster. However, despite prior work on this topic, the problem of discovering options through interaction with an environment remains a challenge. In this paper, we introduce a novel meta-gradient approach for discovering useful options in multi-task RL environments. Our approach is based on a manager-worker decomposition of the RL agent, in which a manager maximises rewards from the environment by learning a task-dependent policy over both a set of task-independent discovered-options and primitive actions. The option-reward and termination functions that define a subgoal for each option are parameterised as neural networks and trained via meta-gradients to maximise their usefulness. Empirical analysis on gridworld and DeepMind Lab tasks show that: (1) our approach can discover meaningful and diverse temporally-extended options in multi-task RL domains, (2) the discovered options are frequently used by the agent while learning to solve the training tasks, and (3) that the discovered options help a randomly initialised manager learn faster in completely new tasks.

研究の動機と目的

  • 人為的に設計された部分目標なしに、マルチタスク強化学習における有用で再利用可能な時間的抽象化(オプション)を自動的に発見する課題に対処すること。
  • タスクの分布に共通する正規性を捉えるオプションを特定することで、サンプル効率と転移学習を向上させること。
  • オプションの報酬関数と終了関数をメタ勾配を用いて同時に学習するスケーラブルでエンドツーエンドの手法を開発すること。
  • オプション発見および下流タスクの学習速度において、既存の階層的強化学習ベースラインを上回ること。

提案手法

  • マネージャー・ワーカー型の階層的強化学習アーキテクチャを採用し、マネージャーがタスク固有のリターンを最大化するためにオプションとプリミティブアクションを選択する。
  • オプション報酬関数と終了関数をニューラルネットワークとしてパrameter化し、複数のトレーニングタスク全体を通しての効用を最大化するようにメタ勾配で最適化する。
  • RLポリシー更新の逆伝播を通じてメタ勾配を計算し、全体的なパフォーマンスへの影響に基づいてオプションパラメータを最適化可能にする。
  • 従来の手法がオプションの持続時間を固定または制約するのに対し、柔軟な時間的スケールを持つオプションを発見できる。
  • ポリシー勾配法を用いてマネージャーとオプションポリシーをエンドツーエンドで同時に学習するための共同アクター・クリティックフレームワーク(MODAC)を採用する。
  • 多様なタスクにわたるオプション行動とメタ目的のパフォーマンスを共同最適化することで、タスクに依存しない部分目標を学習する。

実験結果

リサーチクエスチョン

  • RQ1メタ勾配を用いることで、マルチタスク強化学習における複数のタスクにわたる有用な時間的延長オプションを効果的に発見できるか?
  • RQ2発見されたオプションは意味的で多様かつ再利用可能な行動を捉えており、学習効率を向上させているか?
  • RQ3転送性能とサンプル効率の観点から、MLSH や Option-Critic といった強力なベースラインと比較して、発見されたオプションのパフォーマンスはどの程度か?
  • RQ4DeepMind Lab などの複雑で現実世界に近い環境にもスケーラブルか?
  • RQ5オプション報酬関数と終了条件を学習することで得られる部分目標を用いることで、新しい未学習タスクでの学習が速くなるか?

主な発見

  • MODACは、グリッドワールドおよびDeepMind Lab環境の両方で、明確で多様な時間的延長オプションを効果的に発見した。オプションポリシーの定性的な可視化により、その有効性が裏付けられた。
  • 訓練中、発見されたオプションは頻繁に使用されており、複数のタスクにわたるポリシー最適化に実際に貢献していることが示された。
  • DeepMind Lab タスクにおいて、MODACはFlatエージェントおよび2つの強力なベースライン(MLSH および Option-Critic)よりも、新しい未学習タスクでの学習が速く、優れた転送性能を示した。
  • 500万または1000万のトレーニングサンプルのみで、すべてのサンプルを使用したFlatエージェントを上回る性能を示しており、スケーラビリティとサンプル効率の両面で優れている。
  • 特に転送が必要な状況において、MLSH や Option-Critic よりも学習速度および最終パフォーマンスの両面で優れた性能を達成した。
  • アブレーションスタディにより、オプション報酬関数と終了関数を学習するためのメタ勾配アプローチが、有用で再利用可能なオプションを発見するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。