Skip to main content
QUICK REVIEW

[論文レビュー] How catastrophic can catastrophic forgetting be in linear regression?

Itay Evron, Edward Moroshko|arXiv (Cornell University)|May 19, 2022
Machine Learning and Algorithms被引用数 5
ひとこと要約

この論文は、逐次的タスク学習下での過パラメータ化線形回帰における深刻な忘却(catastrophic forgetting)を、解部分空間への反復的射影として定式化する。データに依存しないきつい上限を導出し、巡回的タスク順序では最悪の場合の忘却が $T^2 \min\{1/\sqrt{k}, d/k\}$ のスケーリングに従うことが示され、一方でランダム順序ではこの値が $d/k$ にまで低下し、$T$ に依存しない。これは、緩和戦略なしにおける continual learning の根本的限界を示している。

ABSTRACT

To better understand catastrophic forgetting, we study fitting an overparameterized linear model to a sequence of tasks with different input distributions. We analyze how much the model forgets the true labels of earlier tasks after training on subsequent tasks, obtaining exact expressions and bounds. We establish connections between continual learning in the linear setting and two other research areas: alternating projections and the Kaczmarz method. In specific settings, we highlight differences between forgetting and convergence to the offline solution as studied in those areas. In particular, when T tasks in d dimensions are presented cyclically for k iterations, we prove an upper bound of T^2 * min{1/sqrt(k), d/k} on the forgetting. This stands in contrast to the convergence to the offline solution, which can be arbitrarily slow according to existing alternating projection results. We further show that the T^2 factor can be lifted when tasks are presented in a random ordering.

研究の動機と目的

  • 逐次学習下での過パラメータ化線形回帰モデルにおける最悪ケースの深刻な忘却を理論的に特徴づけること。
  • 継続的学習、交互射影、およびカツチャルツ法との関連を確立し、忘却に関する新しいデータに依存しない上限を導出すること。
  • 正則化やリプレイなしに、タスク順序(巡回的対ランダム)およびタスク類似度(部分空間間の角度)が忘却に与える影響を調査すること。
  • 明示的な緩和技術が存在しない状況下でも、忘却が最小または最大となる条件を特定すること。

提案手法

  • 継続的学習を、現在の解を各新しいタスクの解部分空間に逐次的に直交射影することでモデル化する。
  • 忘却を $\| (I - P_1)(P_2 P_1)^n \|_2^2$ として、以前のタスクの解からの距離として定量化するため、射影残差の正確な表現を用いる。
  • 交互射影およびカツチャルツ法の道具を用い、忘却に関する一様でデータに依存しない上界および下界を導出する。
  • 2種類のタスク順序方式の下での忘却を分析する:巡回的(固定順序でタスクを繰り返し学習)およびランダム(イambique順序)。
  • 射影行列の積のスペクトル解析を用い、ランダム順序には集中不等式を応用して境界を導出する。
  • グローバル解が存在する実現可能性仮定を想定し、オフライン最小ノルム解への収束を分析可能にする。

実験結果

リサーチクエスチョン

  • RQ1緩和戦略なしに、線形回帰でタスクを逐次学習する場合に発生しうる最悪ケースの忘却はどの程度か?
  • RQ2継続的学習設定下で、巡回的順序とランダム順序の両方において、忘却行動はどのように異なるか?
  • RQ3連続するタスクの解部分空間間の角度が、忘却率を決定する上で果たす役割は何か?
  • RQ4収束が任意に遅い場合でも、非自明なまま残るデータに依存しない忘却の上限を導出可能か?
  • RQ5タスク数 $T$ と次元 $d$ が、巡回的設定下での忘却上界にどのように共同して影響を与えるか?

主な発見

  • 巡回的タスク順序設定下で $T \geq 3$ 個のタスクと $k$ 回の反復を行う場合、忘却は一様に上界 $T^2 \min\{1/\sqrt{k}, d/k\}$ で抑えられる。
  • 同じ巡回的設定下で、忘却は下界 $T^2 / k$ で抑えられ、最悪ケースにおける $T^2$ の依存性がタイトであることが示された。
  • ランダムタスク順序では、期待される忘却は $d/k$ で抑えられ、$T$ に依存しない。これは、最悪ケースの忘却が顕著に低減されることを示している。
  • タスクがほぼ一致する(角度が小さい)場合、繰り返しの露出により忘却が高まるが、中程度の角度では1回のパス後に最も大きな忘却が生じる。
  • この論文は、正則化やリプレイが存在しない状況下でも、忘却が最大に達し、本質的に深刻である可能性があることを示している。
  • 分析により、収束が任意に遅くなる(交互射影の例のように)場合でも、最悪ケースにおける忘却はきつく抑えられることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。