Skip to main content
QUICK REVIEW

[論文レビュー] Lifelong Reinforcement Learning with Modulating Masks

Eseoghene Ben-Iwhiwhu, Saptarshi Nath|arXiv (Cornell University)|Dec 21, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本稿では、継続的学習を可能にするために、長期間の強化学習(LRL)におけるモジュレーティングマスクを導入している。この手法により、災難的忘却を回避しながら、連続するタスクの間で継続的学習が可能になる。特にPPOおよびIMPALAエージェントを用いて、タスク固有のマスクを訓練し、共有バックボーン方策ネットワークをモodulateすることで、優れた性能を達成しており、過去のマスクの線形結合を用いたフォワード転送を可能にし、標準的なRLが対処できない極めてスパarsな報酬タスクを、初期化なしで新たに解決可能である。

ABSTRACT

Lifelong learning aims to create AI systems that continuously and incrementally learn during a lifetime, similar to biological learning. Attempts so far have met problems, including catastrophic forgetting, interference among tasks, and the inability to exploit previous knowledge. While considerable research has focused on learning multiple supervised classification tasks that involve changes in the input distribution, lifelong reinforcement learning (LRL) must deal with variations in the state and transition distributions, and in the reward functions. Modulating masks with a fixed backbone network, recently developed for classification, are particularly suitable to deal with such a large spectrum of task variations. In this paper, we adapted modulating masks to work with deep LRL, specifically PPO and IMPALA agents. The comparison with LRL baselines in both discrete and continuous RL tasks shows superior performance. We further investigated the use of a linear combination of previously learned masks to exploit previous knowledge when learning new tasks: not only is learning faster, the algorithm solves tasks that we could not otherwise solve from scratch due to extremely sparse rewards. The results suggest that RL with modulating masks is a promising approach to lifelong learning, to the composition of knowledge to learn increasingly complex tasks, and to knowledge reuse for efficient and faster learning.

研究の動機と目的

  • タスク固有のポリシー・パラメータを分離するため、モジュレーティングマスクを活用することで、長期間の強化学習(LRL)における災難的忘却と干渉を解消すること。
  • 過去に学習したタスクからの知識を、学習済みマスクの線形結合によって再利用することで、LRLにおけるフォワード転送を可能にすること。
  • 従来、教師あり長期間学習で用いられていたモジュレーティングマスクを、ポリシーグラデント法を用いた深層強化学習へ応用すること。
  • Minigrid、Metaworld、ProcGenのような複雑な環境において、スパース報酬を伴う状況でも、マスクベースのアプローチのスケーラビリティと効率性を実証すること。
  • マスクベースの長期間学習における表現能力とメモリ効率を調査し、マスクの重ね合わせ戦略を提案してストレージを削減すること。

提案手法

  • PPOおよびIMPALAエージェントにおける深層ポリシーネットワークに、勾配降下法で学習されたモジュレーティングマスクを適応させ、それぞれのマスクがバックボーンネットワークのパラメータまたは活性化をモodulateする。
  • バックボーンネットワークを固定したまま、タスク固有のマスクを独立して訓練することで、タスク間での災難的忘却を防止する。
  • 新しいタスクの初期化に、過去に学習したマスクの線形結合を用いることで、知識の転送と収束の高速化を実現する。
  • 新しいタスク学習中に、線形マスク結合の係数を勾配ベース最適化で微調整することで、効率的な適応を可能にする。
  • 推論時にタスク境界を特定し、適切なマスクを割り当てるためのタスクオラクルを導入する。今後の研究では、タスク検出手法との統合を検討する。
  • 各レイヤーごとにスカラーマスクを導入する、または保存するマスクの数を制限することで、メモリ効率を向上させ、新しいタスクを既存マスクの重ね合わせとして学習する。

実験結果

リサーチクエスチョン

  • RQ1モジュレーティングマスクは、連続的および離散的制御タスクの多様な環境において、長期間の強化学習における災難的忘却を効果的に防止できるか?
  • RQ2過去に学習したマスクの線形結合は、特に報酬が極めてスパースな環境において、新しいタスクの学習をどの程度高速化できるか?
  • RQ3標準的なLRLベースラインと比較して、モジュレーティングマスクの使用は、連続的タスク学習における累積的パフォーマンスと安定性にどのような影響を与えるか?
  • RQ4マスクのスパarsityと表現能力は、長期間の強化学習におけるポリシーのパフォーマンスと一般化能力にどのような影響を及えるか?
  • RQ5タスク検出メカニズムと統合することで、未知または動的に変化するタスク境界に対応できるか、マスクベースのアプローチを拡張可能か?

主な発見

  • モジュレーティングマスクアプローチは、Minigrid、CT-Graph、Metaworld、ProcGenといったLRLベンチマークで優れたパフォーマンスを達成し、災難的忘却は観察されなかった。
  • 過去のマスクの線形結合によりフォワード転送が可能となり、報酬が1エピソードあたり5.6×10⁻⁶という極めてスパースな環境でも、ランダム探索のみでタスクを解決できた。
  • 過去のマスクの線形結合による初期化により、新しいタスクでの収束が著しく高速化され、初期化なしでの学習に比べて顕著に優れた性能を示した。
  • 本アプローチはメモリ効率が高く、保存するマスク数を制限し、線形重ね合わせにより再利用することで、タスク数の増加に伴いストレージ要件を大幅に削減できる。
  • レイヤーごとのスカラーマスクやスパースなバイナリーマスクを用いることで、パフォーマンスを維持しながらメモリフットプリントを削減でき、大規模なタスク集合へのスケーラビリティが示唆された。
  • PPOおよびIMPALAという複数のRLアルゴリズムで本手法の有効性が検証されたため、深層ポリシーオプティマイゼーションフレームワークへの広範な適用可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。