Skip to main content
QUICK REVIEW

[論文レビュー] Gradient Episodic Memory with a Soft Constraint for Continual Learning

Guannan Hu, Wu Zhang|arXiv (Cornell University)|Nov 16, 2020
Domain Adaptation and Few-Shot Learning参考文献 20被引用数 9
ひとこと要約

本論文では、平均勾配エピソードメモリ(A-GEM)を改善するため、学習済み知識の保持と新規タスクの学習のバランスを取るために、ε ∈ [0,1] のソフト制約を導入した新たな連続学習手法 ε-SOFT-GEM を提案する。エピソードメモリと更新勾配の間の勾配角度制約を課すことにより、最小限の計算およびメモリオーバーヘッドで最先端の精度を達成し、1エポック訓練において A-GEM や他のベンチマークを上回る性能を発揮する。

ABSTRACT

Catastrophic forgetting in continual learning is a common destructive phenomenon in gradient-based neural networks that learn sequential tasks, and it is much different from forgetting in humans, who can learn and accumulate knowledge throughout their whole lives. Catastrophic forgetting is the fatal shortcoming of a large decrease in performance on previous tasks when the model is learning a novel task. To alleviate this problem, the model should have the capacity to learn new knowledge and preserve learned knowledge. We propose an average gradient episodic memory (A-GEM) with a soft constraint $ε\in [0, 1]$, which is a balance factor between learning new knowledge and preserving learned knowledge; our method is called gradient episodic memory with a soft constraint $ε$ ($ε$-SOFT-GEM). $ε$-SOFT-GEM outperforms A-GEM and several continual learning benchmarks in a single training epoch; additionally, it has state-of-the-art average accuracy and efficiency for computation and memory, like A-GEM, and provides a better trade-off between the stability of preserving learned knowledge and the plasticity of learning new knowledge.

研究の動機と目的

  • 連続学習における災難的忘却(catastrophic forgetting)を解消すること、すなわち、新しいタスクを学習する際に過去のタスクの性能が低下することを防ぐこと。
  • A-GEM を改善するため、新規知識の学習と古い知識の保持のバランスを取るためのソフト制約 ε を導入すること。
  • モデルが過去のタスクの損失を増加させないだけでなく、積極的に減少させることで、エピソードメモリから新たな知識を習得できることを実現すること。
  • 性能向上を図る一方で、A-GEM と同等の計算およびメモリ効率を維持すること。
  • 複数回の訓練繰り返しを通じてヒューリスティック探索を用いて ε の最適化戦略を検討すること。

提案手法

  • 学習の柔軟性(新しいタスクの学習)と安定性(過去のタスクの保持)のトレードオフを調整するため、ε ∈ [0,1] のソフト制約を導入する。
  • 勾配更新則を変更し、エピソードメモリの勾配と更新後の勾配との間の角度が 90° 以下になるように制約を課すことで、過去のタスクの損失低下を保証する。
  • エピソードメモリからの基準勾配を用い、最適化中にソフト制約を適用する A-GEM の変種として ε-SOFT-GEM を提案する。
  • エピソードメモリと新規タスクデータの勾配を平均化し、同じ角度制約を適用することで過去のタスク性能を維持する A-A-GEM を提案する。
  • 複数回の訓練繰り返しを通じて、性能のトレンドに基づいて ε を更新するヒューリスティック最適化戦略を採用する。
  • 勾配正規化と制約の適用を最小限に抑え、A-GEM と同等の効率を維持する。

実験結果

リサーチクエスチョン

  • RQ1固定制約と比較して、ソフト制約 ε が連続学習における柔軟性と安定性のバランスを改善できるか?
  • RQ2エピソードメモリの勾配と更新勾配の間の勾配角度を 90° 以下に制約することで、過去のタスクから積極的な知識習得が可能になるか?
  • RQ3ε-SOFT-GEM は A-GEM や他のベースラインと比較して、同等の計算およびメモリ効率を維持しながらより高い平均精度を達成できるか?
  • RQ4エピソードメモリのサイズが、ε-SOFT-GEM、A-GEM、A-A-GEM の性能に与える影響は何か?
  • RQ5Permuted MNIST や Split-CIFAR のような異なる連続学習ベンチマークにおいて、最適な ε 値は何か?

主な発見

  • ε-SOFT-GEM は、平均精度と忘却の低減という観点で、A-GEM や他の連続学習ベンチマークを上回り、特に1エポック訓練において顕著な優位性を示す。
  • ヒューリスティック最適化戦略を用い、5回の訓練繰り返し後に、Permuted MNIST では最適な ε 値が 0.07185、Split-CIFAR では 0.5 であることが特定された。
  • EWC や MAS といった正則化ベースの手法と比較して、ε-SOFT-GEM はより優れた安定性(低い忘却)と柔軟性(速い学習)を達成している。
  • A-A-GEM は ε-SOFT-GEM とほぼ同等の性能を示すが、ハイパーパramータのチューニングを必要としないため、角度制約自体が ε がなくても有効であることが示唆される。
  • エピソードメモリのサイズが大きいほど、ε-SOFT-GEM、A-GEM、A-A-GEM の性能が向上し、A-T および F-T メトリクスが向上する。これは、過去のタスク勾配のより良い表現が得られるためである。
  • 本手法は、A-GEM とほぼ同一の計算およびメモリ効率を維持しており、追加の勾配正規化ステップ1つを追加するにとどまる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。