Skip to main content
QUICK REVIEW

[論文レビュー] Continual Learning Using World Models for Pseudo-Rehearsal

Nicholas Ketz, Soheil Kolouri|arXiv (Cornell University)|Mar 6, 2019
Model Reduction and Neural Networks参考文献 31被引用数 4
ひとこと要約

本稿では、過去の経験の内部生成ロールアウトを現実の環境との相互作用と入れ替えることで、消去的忘却を防ぐ、ラベルフリーの継続的学習手法を世界モデルに適用する。この手法により、タスクの分割なしに、順次的なAtariゲームにおいて安定した自己教師付き時系列予測と部分的な継続的学習が可能になる。

ABSTRACT

The utility of learning a dynamics/world model of the environment in reinforcement learning has been shown in a many ways. When using neural networks, however, these models suffer catastrophic forgetting when learned in a lifelong or continual fashion. Current solutions to the continual learning problem require experience to be segmented and labeled as discrete tasks, however, in continuous experience it is generally unclear what a sufficient segmentation of tasks would be. Here we propose a method to continually learn these internal world models through the interleaving of internally generated episodes of past experiences (i.e., pseudo-rehearsal). We show this method can sequentially learn unsupervised temporal prediction, without task labels, in a disparate set of Atari games. Empirically, this interleaving of the internally generated rollouts with the external environment's observations leads to a consistent reduction in temporal prediction loss compared to non-interleaved learning and is preserved over repeated random exposures to various tasks. Similarly, using a network distillation approach, we show that modern policy gradient based reinforcement learning algorithms can use this internal model to continually learn to optimize reward based on the world model's representation of the environment.

研究の動機と目的

  • 長期間にわたる強化学習における消去的忘却を、明示的なタスク分割を要せずに対処すること。
  • 疑似再現が、ラベルなしの連続的環境において世界モデルの性能を維持できるかどうかを検討すること。
  • 内部世界モデルが、深層強化学習エージェントの継続的ポリシー学習を支援するうえでどのような役割を果たすかを評価すること。
  • 模擬的ロールアウトが表現の安定性を維持し、転移を可能にする役割をどのように果たすかを調査すること。

提案手法

  • 世界モデルアーキテクチャ(M)を用い、生のピクセル遷移を学習することで、将来の状態、行動、報酬を予測する。
  • 疑似再現は、保存された世界モデルのコピー(M*)から生成された合成的ロールアウトを、学習中の現実の経験と入れ替えることで実装する。
  • 内部モデルは、現実の遷移と模擬的遷移の両方に対して、自己教師付き時系列予測損失により訓練される。
  • 別個のエージェント(C)は方策勾配法を用いて訓練され、世界モデルの潜在的表現を意思決定の入力として使用する。
  • 学習プロセスは、世界モデルとエージェントの更新を、現実のデータと模擬的データの両方を用いて交互に実行する。
  • タスクラベルの使用を避けるために、環境のストリームを連続的かつラベルなしの経験の連続とみなす。

実験結果

リサーチクエスチョン

  • RQ1疑似再現を用いることで、タスク分割なしに継続的かつラベルなしの環境で世界モデル学習を安定化できるか?
  • RQ2模擬的ロールアウトを現実の経験と入れ替えることで、時間経過に伴い時系列予測損失にどのような影響を与えるか?
  • RQ3内部世界モデルが強化学習エージェントの継続的ポリシー学習をどの程度支援できるか?
  • RQ4疑似再現のロールアウト品質と世界モデルの性能保持との間にどのような関係があるか?
  • RQ5本手法は、明示的なタスク境界がない状態で、異なるAtariゲーム間での知識の転送を可能にするか?

主な発見

  • 疑似再現を用いた入れ替え学習は、繰り返しの露出に対して、非入れ替え学習と比較して一貫した時系列予測損失の低減をもたらした。
  • 新しいタスクへの複数回のランダムな露出後でさえ、以前に学習したAtariゲームで世界モデルの性能が安定したままであり、消去的忘却が軽減されたことが示された。
  • 制御エージェントにおいては、疑似再現によりタスク1(River Raid)の累積報酬が向上したが、後期のエポックでは非入れ替え学習で顕著な性能低下が観察された。
  • 報酬のないタスク2(Tutankham)では顕著な性能差が認められず、タスク3(Crazy Climber)では低複雑性または高いばらつきのため、顕著な利益が得られなかった。
  • 結果から、世界モデルは疑似再現により著しく恩恵を受けるが、エージェントの継続的学習は行動空間表現や学習ダイナミクスといったアーキテクチャ的選択により敏感であることが示唆された。
  • 本研究は、特に自己教師付き世界モデル学習において、疑似再現がラベルフリーの継続的学習設定で有効である可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。