Skip to main content
QUICK REVIEW

[論文レビュー] Layerwise Optimization by Gradient Decomposition for Continual Learning

Shixiang Tang, Dapeng Chen|arXiv (Cornell University)|May 17, 2021
Domain Adaptation and Few-Shot Learning参考文献 57被引用数 4
ひとこと要約

本稿では、エピソードメモリからの勾配を共有成分とタスク固有成分に分解する、継続的学習のための新規フレームワークを提案する。共有勾配との一貫性とタスク固有勾配との直交性を強制することで、知識の保持を向上させる。勾配の大きさの不均衡を緩和するため、層ごとに最適化を行うことで、複数の継続的学習ベンチマークで最先端の性能を達成し、GEM や S-GEM よりも Split Tiny ImageNet で最大 3.9% の向上を達成する。

ABSTRACT

Deep neural networks achieve state-of-the-art and sometimes super-human performance across various domains. However, when learning tasks sequentially, the networks easily forget the knowledge of previous tasks, known as "catastrophic forgetting". To achieve the consistencies between the old tasks and the new task, one effective solution is to modify the gradient for update. Previous methods enforce independent gradient constraints for different tasks, while we consider these gradients contain complex information, and propose to leverage inter-task information by gradient decomposition. In particular, the gradient of an old task is decomposed into a part shared by all old tasks and a part specific to that task. The gradient for update should be close to the gradient of the new task, consistent with the gradients shared by all old tasks, and orthogonal to the space spanned by the gradients specific to the old tasks. In this way, our approach encourages common knowledge consolidation without impairing the task-specific knowledge. Furthermore, the optimization is performed for the gradients of each layer separately rather than the concatenation of all gradients as in previous works. This effectively avoids the influence of the magnitude variation of the gradients in different layers. Extensive experiments validate the effectiveness of both gradient-decomposed optimization and layer-wise updates. Our proposed method achieves state-of-the-art results on various benchmarks of continual learning.

研究の動機と目的

  • タスク間の勾配情報を利用することで、勾配を独立に扱うのではなく、継続的学習における深刻な忘却を緩和する。
  • 従来の方法が層ごとの勾配を連結するため、高マグニチュードの層に支配されてしまうという制限を克服する。
  • 共通する知識(すべての古いタスクに共通するもの)とタスク固有の知識(個々のタスクに固有のもの)を区別することで、知識の保持を向上させる。
  • 勾配の大きさの変動の影響を軽減するため、層ごとの最適化戦略を開発し、各層ごとに勾配更新を分離する。
  • タスクインクリメンタルおよびクラスインクリメンタルな継続的学習の両設定で、最先端の性能を達成する。

提案手法

  • 各古いタスクの勾配を、すべての古いタスクに共通する共通成分と、そのタスク固有の成分に分解する。
  • 更新勾配が共有勾配と内積が非負になるように制約を課し、共通知識の統合を促進する。
  • 更新勾配がすべてのタスク固有勾配が張る空間と直交するように制約を課し、タスク固有知識の保存を図る。
  • 厳密な直交性制約を緩和するために主成分分析(PCA)を適用し、最も重要な勾配方向に焦点を当てる。
  • 各層で勾配制約を独立して解くことで、層ごとの最適化を実装し、連結された勾配による大きさの不均衡を回避する。
  • エピソードメモリリプレイと勾配制約を組み合わせ、継続的学習中に古いタスクと新しいタスクの損失を同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1タスク間の勾配情報は、継続的学習における知識統合の向上に有効に分離可能か?
  • RQ2タスク固有勾配部分空間への直交性を強制することで、干渉を最小限に抑えつつタスク固有知識を保存できるか?
  • RQ3層ごとの勾配最適化により、高マグニチュード勾配の支配を軽減し、古いタスクのパフォーマンスを向上させられるか?
  • RQ4GEM や A-GEM といった従来の勾配制約手法と比較して、勾配分解は忘却と精度の観点でどのように異なるか?
  • RQ5提案手法は、タスクインクリメンタルおよびクラスインクリメンタルなシナリオを含む、さまざまな継続的学習設定に一般化可能か?

主な発見

  • 1エポックで Split CIFAR100 を処理した場合、本手法は GEM の 65.8% から 69.3% に向上し、3.5% の向上を達成した。
  • 1エポックで Split Tiny ImageNet を処理した場合、本手法は 38.1% の精度を達成し、GEM の 34.2% よりも 3.9% の向上を達成した。
  • Split CIFAR100 のクラスインクリメンタル設定では、本手法は 65.3% の精度を達成し、最先端の MUC 法と同等の性能を示し、GEM よりも 3% の向上を達成した。
  • MNIST Permutation および Split CIFAR10 のすべてのベンチマークで、本手法は GEM、A-GEM、S-GEM を常に上回った。
  • アブレーションスタディの結果、勾配分解と層ごとの最適化の両方が、性能向上に顕著な貢献をしていることが確認された。
  • 層ごとの戦略により、古いタスクの損失を低減する効率が向上し、収束が速く、忘却率も低くなったことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。