Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Compose Skills

Himanshu Sahni, Saurabh Kumar|arXiv (Cornell University)|Nov 30, 2017
Reinforcement Learning in Robotics参考文献 20被引用数 20
ひとこと要約

本論文では、スキル状態埋め込みと学習可能な構成関数を用いて事前学習済みスキルを組み合わせる微分可能フレームワーク、ComposeNetを提案する。この手法により、線形時相論理(LTL)仕様を用いて複雑なタスクの効率的学習が可能となる。本手法は、未学習のスキル組み合わせに対してもゼロショット一般化を達成し、エンドツーエンド学習やスキルトランクの微調整を上回る性能を発揮する。

ABSTRACT

We present a differentiable framework capable of learning a wide variety of compositions of simple policies that we call skills. By recursively composing skills with themselves, we can create hierarchies that display complex behavior. Skill networks are trained to generate skill-state embeddings that are provided as inputs to a trainable composition function, which in turn outputs a policy for the overall task. Our experiments on an environment consisting of multiple collect and evade tasks show that this architecture is able to quickly build complex skills from simpler ones. Furthermore, the learned composition function displays some transfer to unseen combinations of skills, allowing for zero-shot generalizations.

研究の動機と目的

  • 従来の階層的強化学習における、スキルの柔軟かつ効率的な組み合わせの制限を解消すること。
  • 微分可能構成関数を用いて、未学習のスキル組み合わせに対してもゼロショット一般化を可能にすること。
  • 複数の組み合わせタスクにわたって事前学習済みスキルポリシーを再利用することで、サンプルの複雑さを低減すること。
  • スキル状態埋め込みが、効果的な構成に必要なタスク関連情報を十分に表現していることを示すこと。
  • 再帰的構成が、より複雑な行動の階層的学習を可能にすること。

提案手法

  • スキルポリシーは、状態に依存するポリシー情報を1つの微分可能層に要約するスキル状態埋め込みを出力する特殊なアーキテクチャを用いて学習される。
  • 構成関数は複数のスキルの埋め込みを入力とし、組み合わせタスク用のポリシーを出力する。この関数はポリシー勾配を用いてエンドツーエンドで訓練される。
  • タスクは線形時相論理(LTL)を用いて指定され、'Aを収集しながらBを避ける'や'まずAを収集してからBを収集する'といった表現力があり意味的に明確な組み合わせが可能になる。
  • フレームワークは再帰的構成をサポートしており、より単純なスキルから階層的なスキル構造を構築できる。
  • アブレーションスタディにより、スキル状態埋め込みと構成層の両方が必要であることが検証され、いずれかを削除または置き換えると性能が著しく低下することが示された。
  • 構成関数はポリシー勾配法を用いて訓練され、組み合わせ環境における累積割引報酬を最大化するという目的関数を持つ。

実験結果

リサーチクエスチョン

  • RQ1学習可能な構成関数は、再訓練を伴わずに事前学習済みスキルポリシーを効果的に組み合わせ、複雑なタスクを解けるか?
  • RQ2本フレームワークは、未学習のスキル組み合わせに対しても一般化可能であり、ゼロショット学習を可能にするか?
  • RQ3スキル状態埋め込みは、学習可能な構成をサポートするために、生のポリシー重みよりも優れているか?
  • RQ4スキルの再帰的構成により、より複雑なタスクに対する階層的行動が生成可能か?
  • RQ5構成関数に誤ったまたは関係のないスキルを用いることで、どのような影響が生じるか?

主な発見

  • 正しいスキルが組み合わされた場合に構成関数は最高の性能を発揮するが、誤ったまたは関係のないスキルが使用されると顕著な性能低下が生じる。
  • '赤を収集'と'緑を避ける'スキルを組み合わせると、'赤を収集しながら緑を避ける'タスクで最良の性能が得られる。一方、'緑を収集'と'赤を避ける'を組み合わせても正の報酬は得られるが、それより低い。
  • 例えば'青を収集'と'青を避ける'といった関係のない2つのスキルを用いる場合、学習が全く進まず、埋め込みがタスク関連情報を正しく表現している必要があることが示された。
  • 単一のスキルトランクの上に新しいポリシー層を訓練する方法は、特に複数のスキル間の連携を要するタスクではComposeNetに劣る。
  • '赤を収集してから緑を収集'タスクでは、単一のスキルトランクを微調整する方法は正しい順序を学習できず、一方ComposeNetは必要な順序を正しく学習できた。
  • 構成関数は未学習のタスクに対しても一般化可能であり、ゼロショット能力を示し、少ない環境サンプルで迅速に収束することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。