Skip to main content
QUICK REVIEW

[論文レビュー] Lifelong Learning using Eigentasks: Task Separation, Skill Acquisition, and Selective Transfer

Aswin Raghavan, Jesse Hostetler|arXiv (Cornell University)|Jul 14, 2020
Multimodal Machine Learning Applications参考文献 45被引用数 4
ひとこと要約

本論文は、生成的リプレイとスティルベースのタスク分離を組み合わせた eigentask フレームワークを導入し、覚醒-睡眠サイクルを用いて継続的教師あり学習で最先端の性能を達成するとともに、強化学習においては OWVAE を用いてタスクに適した助言を生成することで前向きの知識転送を実現した。StarCraft 2 では、10倍少ないサンプルで単一タスク学習を1.5倍上回った。

ABSTRACT

We introduce the eigentask framework for lifelong learning. An eigentask is a pairing of a skill that solves a set of related tasks, paired with a generative model that can sample from the skill's input space. The framework extends generative replay approaches, which have mainly been used to avoid catastrophic forgetting, to also address other lifelong learning goals such as forward knowledge transfer. We propose a wake-sleep cycle of alternating task learning and knowledge consolidation for learning in our framework, and instantiate it for lifelong supervised learning and lifelong RL. We achieve improved performance over the state-of-the-art in supervised continual learning, and show evidence of forward knowledge transfer in a lifelong RL application in the game Starcraft2.

研究の動機と目的

  • 継続的機械学習における災難的忘却の緩和と前向きの知識転送の実現。
  • 生成モデルを用いたスケーラブルでコンテンツアドレス可能な記憶システムとしてのスキルの開発。
  • 生成的リプレイを忘却の緩和を超えて、前向きの転送を支援する仕組みへと拡張すること。
  • スティルベースの助言を用いることで、継続的強化学習における効率的な探索の実現。
  • 継続的学習ベンチマークおよび実世界の強化学習環境における性能向上と知識転送の実証。

提案手法

  • eigentask フレームワークは、生成モデル(生成器)とタスク固有のスキル(識別モデル)をペアにし、スキルのコンテンツアドレス可能な記憶として構築する。
  • OWVAE は複数の VAE を生成器として用い、潜在空間における尤度比検定を適用して入力を eigentasks に割り当てる。
  • 生成器とスキルの損失を組み合わせた共同損失関数を用い、尤度比で重み付けすることでエンドツーエンドの学習を可能にする。
  • スティル予測の信頼度を用いたリジェクションサンプリングにより、分布外の生成サンプルをフィルタリングし、リプレイの品質を向上させる。
  • 強化学習では、フレームワークが OWVAE を用いて過去の関連スキルを「助言」として取得し、メインポリシーと混合ポリシーとして統合する。
  • 覚醒(タスク学習)と睡眠(知識統合)を繰り返すウェークスリープサイクルにより、継続的適応が可能になる。

実験結果

リサーチクエスチョン

  • RQ1生成的リプレイを忘却の緩和を超えて、前向きの知識転送を可能にする拡張は可能か?
  • RQ2構造的生成モデリングを用いてタスクの分離をどのように達成できるか? これにより継続的学習がどのように向上するか?
  • RQ3過去の経験から得たスティルベースの助言は、継続的強化学習における探索と学習効率を向上させることができるか?
  • RQ4eigentasks を用いた選択的知識転送は、継続的学習ベンチマークにおいて、標準的な生成的リプレイと比べてどのように異なるか?
  • RQ5eigentask は、以前に学習したタスクと類似した新しいタスクへの適応をどの程度速く可能にするか?

主な発見

  • OWVAE は、混合 MNIST/FashionMNIST の継続的学習ベンチマークで最先端の性能を達成し、先行する生成メモリ手法を上回った。
  • 本手法は優れたタスク分離を示し、各 VAE 生成器から得られる明確で高品質なサンプルが視覚的に確認された。
  • スティルの信頼度に基づくリジェクションサンプリングにより、標準的なリプレイと比較して忘却が軽減され、継続的学習性能が向上した。
  • StarCraft 2 において、本手法は前向きの知識転送を実現した:DefeatZerglingsAndBanelings タスクでは、10倍少ない強化学習サンプルで単一タスク学習を1.5倍上回った。
  • 前向きの知識転送は、類似したタスク間(例:戦闘→戦闘)での転送が最も効果的であったが、タスクが不一致な場合、スキル選択の不一致により効果が薄れた。
  • 本フレームワークは、1つの StarCraft 2 ミニゲームにおいて、完全畳み込みポリシー(FullyConv)アーキテクチャの最良の公表済み性能を上回り、実用的なスケーラビリティと効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。