Skip to main content
QUICK REVIEW

[論文レビュー] Overcoming catastrophic forgetting problem by weight consolidation and long-term memory

Shixian Wen, Laurent Itti|arXiv (Cornell University)|May 18, 2018
Domain Adaptation and Few-Shot Learning参考文献 12被引用数 13
ひとこと要約

この論文は、敵対的メモリユニットとエラスティックウェイトコンsolidation(EWC)を組み合わせることで、継続的学習における深刻な忘却を軽減する新しい手法を提案する。過去のタスクの抽象的で高レベルな特徴を表す敵対的部分空間の共通部分をメモリユニットに格納することで、新しいタスクを学習しながらも古い知識を保持し、MNISTの数字を順次学習した後、タスク1で94.53%の精度を達成した。これはEWCや単純な勾配降下法を著しく上回る結果である。

ABSTRACT

Sequential learning of multiple tasks in artificial neural networks using gradient descent leads to catastrophic forgetting, whereby previously learned knowledge is erased during learning of new, disjoint knowledge. Here, we propose a new approach to sequential learning which leverages the recent discovery of adversarial examples. We use adversarial subspaces from previous tasks to enable learning of new tasks with less interference. We apply our method to sequentially learning to classify digits 0, 1, 2 (task 1), 4, 5, 6, (task 2), and 7, 8, 9 (task 3) in MNIST (disjoint MNIST task). We compare and combine our Adversarial Direction (AD) method with the recently proposed Elastic Weight Consolidation (EWC) method for sequential learning. We train each task for 20 epochs, which yields good initial performance (99.24% correct task 1 performance). After training task 2, and then task 3, both plain gradient descent (PGD) and EWC largely forget task 1 (task 1 accuracy 32.95% for PGD and 41.02% for EWC), while our combined approach (AD+EWC) still achieves 94.53% correct on task 1. We obtain similar results with a much more difficult disjoint CIFAR10 task, which to our knowledge had not been attempted before (70.10% initial task 1 performance, 67.73% after learning tasks 2 and 3 for AD+EWC, while PGD and EWC both fall to chance level). Our results suggest that AD+EWC can provide better sequential learning performance than either PGD or EWC.

研究の動機と目的

  • ディスjオイントタスクの順次学習において、深層ニューラルネットワークを用いた深刻な忘却を解消すること。
  • EWCの制限を克服すること。EWCは過去のタスクの最適解の近傍に限定的に学習を制限し、より良い共同最小値を逃す可能性がある。
  • 敵対的部分空間を、長期記憶用の高レベルで抽象的な古いタスク知識の表現として活用すること。
  • 旧データのリプレイやネットワークパラメータの凍結なしに、効果的な継続的学習を可能にすること。
  • MNISTおよびCIFAR10のディスジョイントタスクベンチマークにおいて、スケーラビリティとロバストネスを示すこと。

提案手法

  • 各ニューロンにメモリユニットを導入し、タスクの全クラスにおける敵対的部分空間の共通部分を表す敵対的勾配を格納する。
  • 高速勾配符号法を用いて敵対的方向を計算し、それをメモリユニットに埋め込み、古いタスク知識のコンactで高レベルな表現とする。
  • メモリユニットの活性化と標準的なネットワーク重み、EWC正則化を組み合わせて、より良い共同最適化を可能にする新しいパrameter空間($\beta$ と $\gamma$)を構築する。
  • EWCを用いて、過去のタスクに重要なパラメータを正則化する一方で、敵対的メモリを用いて古いタスクの学習を安定化させる。
  • シグモイド交差エントロピー損失を用いて、タスク固有の勾配フローを可能にし、ディスジョイントタスク間の干渉を低減する。
  • 各タスクを20エポック訓練し、全過去タスクの性能を評価することで、忘却度を測定する。

実験結果

リサーチクエスチョン

  • RQ1敵対的部分空間は、深刻な忘却を防ぐために、安定的で高レベルな古いタスク知識の表現として利用可能か?
  • RQ2敵対的メモリとEWCを組み合わせることで、EWCや単純なSGDに比べて継続的学習の性能が向上するか?
  • RQ3データリプレイなしで、CIFAR10のような困難なディスジョイントタスクベンチマークにも一般化可能か?
  • RQ4シグモイド交差エントロピー損失の使用が、ディスジョイントタスク設定における性能に与える影響は何か?
  • RQ5メモリユニットは、パラメータの凍結やデータリプレイなしに、古いタスク知識の効果的な再取得を可能にするか?

主な発見

  • AD+EWC手法は、ディスジョイントMNISTでタスク2(4–6)とタスク3(7–9)を学習した後、タスク1(0–2)で94.53%の精度を達成した。これはPGD(32.95%)やEWC(41.02%)を著しく上回る結果であった。
  • より困難なディスジョイントCIFAR10タスクでは、AD+EWCは順次学習後もタスク1で67.73%の精度を維持したが、PGDとEWCはともに運試しレベルまで低下した。
  • AD単体では、重みが凍結されているためタスク1で100%の精度を達成したが、後続のタスクで失敗した。これは、メモリのみで十分ではなく、適応的学習が必要であることを示している。
  • この手法は共有出力設定と個別出力設定の両方で効果的に機能したが、EWCやPGDは個別出力設定でラベルの混乱により失敗した。
  • シグモイド交差エントロピー損失の使用により、タスク固有の勾配フローが可能になり、性能が向上した。ただし、畳み込み構造がないと収束が遅くなった。
  • 敵対的部分空間の共通部分は、スケーラブルで抽象的な長期記憶表現を形成し、データリプレイなしで効果的な継続的学習を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。