Skip to main content
QUICK REVIEW

[論文レビュー] Wide Neural Networks Forget Less Catastrophically

Seyed Iman Mirzadeh, Arslan Chaudhry|arXiv (Cornell University)|Oct 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 57被引用数 4
ひとこと要約

本稿では、深さよりも幅を広げることで、継続的学習における危険な忘却(catastrophic forgetting)が顕著に軽減されることを示している。幅広いネットワークは、勾配の直交性、スパarsity、およびラジカルな学習状態の向上により、既存の継続的学習アルゴリズムに加えて顕著な改善効果をもたらす。この改善は、アルゴリズムの改変なしに達成可能である。

ABSTRACT

A primary focus area in continual learning research is alleviating the "catastrophic forgetting" problem in neural networks by designing new algorithms that are more robust to the distribution shifts. While the recent progress in continual learning literature is encouraging, our understanding of what properties of neural networks contribute to catastrophic forgetting is still limited. To address this, instead of focusing on continual learning algorithms, in this work, we focus on the model itself and study the impact of "width" of the neural network architecture on catastrophic forgetting, and show that width has a surprisingly significant effect on forgetting. To explain this effect, we study the learning dynamics of the network from various perspectives such as gradient orthogonality, sparsity, and lazy training regime. We provide potential explanations that are consistent with the empirical results across different architectures and continual learning benchmarks.

研究の動機と目的

  • 継続的学習における危険な忘却に及ぼすアーキテクチャ的特性、特に幅と深さの影響を調査すること。
  • 幅による過パラメータ化が、深さによる過パラメータ化よりも、忘却をより効果的に軽減するかどうかを特定すること。
  • 幅広いネットワークがより少ない忘却を示す理由を説明する内在的メカニズム(勾配の直交性、スパarsity、ラジカルな学習状態など)を探索すること。
  • 幅の利点が、リプレイや正則化などの既存の継続的学習アルゴリズムと加法的に作用するかどうかを評価すること。
  • アルゴリズム的干渉なしに、アーキテクチャ設計が継続的学習性能に与える影響を基礎的に理解すること。

提案手法

  • MLPおよびWideResNetを用いて、Rotated MNISTとSplit CIFAR-100という2つの継続的学習ベンチマークで、幅の影響を実験的に評価する。
  • 深さを一定に保ちながら、幅を変化させたネットワーク(例:32〜2048ユニット)を比較し、タスク間での忘却度と平均精度を測定する。
  • 勾配ダイナミクスを直交性とスパarsityの指標を用いて分析し、忘却の低減を説明する。
  • パラメータの初期値からの距離を測定することで、ラジカルな学習状態を調査し、忘却の低減と関連付ける。
  • リプレイ(例:ER)、A-GEM、LwF、EWCなどの既存の継続的学習アルゴリズムと組み合わせて、同じ幅の影響を評価し、加法的利点を検証する。
  • パラメータ数を固定した制御実験を実施し、幅と深さの影響を分離し、浅く広い構造と深く細い構造を比較する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークの幅を広げることで、継続的学習における危険な忘却が軽減されるか?もしそうなら、どの程度の効果が得られるか?
  • RQ2幅と深さを比較した場合、忘却の軽減にどの程度の違いが生じるか?深さを増すことで、同様の利点が得られるか、あるいは逆効果となるか?
  • RQ3幅広いネットワークの性能向上を説明する背後にあるトレーニングダイナミクス(勾配の直交性、スパarsity、ラジカルな学習状態など)は何か?
  • RQ4幅の利点は、リプレイや正則化といった既存の継続的学習アルゴリズムと加法的に作用するか?
  • RQ5幅によるアーキテクチャ的過パラメータ化は、危険な忘却を根本的に軽減する、アルゴリズムに依存しない解決策として機能できるか?

主な発見

  • 2層のMLPの幅を32ユニットから2048ユニットに拡大したことで、5つのタスクを学習後、Rotated MNISTにおける忘却率が62%から48%に低下した。
  • Split CIFAR-100において、WideResNet-10の幅要因を1から8に増加させたことで、20のタスク学習後、最初のタスクの忘却率が42%から31%に低下した。
  • リプレイバッファを一切使用しない幅広いネットワークでも、リプレイバッファサイズが125または250の狭いネットワークと同等またはそれ以上の性能を達成した。
  • 浅く広いネットワーク(例:深さ10、幅8)は平均精度59.7%、忘却率29.4%を達成し、パラメータ数がほぼ同じであるが深く細いバージョン(例:深さ28、幅3)の平均精度49.4%、忘却率36.2%を上回った。
  • 幅の利点は、ER、A-GEM、LwF、EWCといった複数の継続的学習アルゴリズムにおいて一貫して加法的であり、平均精度の向上と忘却の低減を両方とも実現した。
  • 幅を一定に保ちながら深さを増加させても、忘却に肯定的または否定的な影響はなく、幅が危険な忘却を軽減する上で特異的な役割を果たしていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。