Skip to main content
QUICK REVIEW

[論文レビュー] Dissecting Catastrophic Forgetting in Continual Learning by Deep Visualization

Giang Nguyen, Chen Shuan|arXiv (Cornell University)|Jan 6, 2020
Domain Adaptation and Few-Shot Learning参考文献 28被引用数 8
ひとこと要約

本稿では、予測差分分析とIoUに基づく忘却測定を活用し、継続的学習における深刻な記憶消失(catastrophic forgetting)を可視化的に解明する新規手法Auto DeepVisを提案する。特に、ResNet-50のブロック3および4に顕著な活性化シフトが生じる主要な感受性(forgetting-prone)層を同定する。提案手法である臨界凍結(critical freezing)は、これらの層のみを凍結することで、旧タスクおよび新タスクの両方でベースラインを上回る優れた性能を達成する。

ABSTRACT

Interpreting the behaviors of Deep Neural Networks (usually considered as a black box) is critical especially when they are now being widely adopted over diverse aspects of human life. Taking the advancements from Explainable Artificial Intelligent, this paper proposes a novel technique called Auto DeepVis to dissect catastrophic forgetting in continual learning. A new method to deal with catastrophic forgetting named critical freezing is also introduced upon investigating the dilemma by Auto DeepVis. Experiments on a captioning model meticulously present how catastrophic forgetting happens, particularly showing which components are forgetting or changing. The effectiveness of our technique is then assessed; and more precisely, critical freezing claims the best performance on both previous and coming tasks over baselines, proving the capability of the investigation. Our techniques could not only be supplementary to existing solutions for completely eradicating catastrophic forgetting for life-long learning but also explainable.

研究の動機と目的

  • 継続的学習における深層ニューラルネットワークの災難的忘却の内部メカニズムを理解すること。
  • タスクやモデルレベルではなく、コンponentレベル(例:フィルタ、ブロック)での忘却を可視化・局所化するツールを開発すること。
  • 段階的学習中に忘却に最も寄与する最も感受性の高い層を同定すること。
  • 最も脆弱なコンponentのみを凍結する、標的的で説明可能な解決策(臨界凍結)を提案すること。
  • 単純なベンチマークを避けて、複雑な視覚言語タスク(画像キャプション生成)で本手法を検証すること(Split MS-COCOを用いて)。

提案手法

  • Auto DeepVisは予測差分分析(PDA)を用い、予測を支持または反転させるピクセルを同定することで、タスク間での特徴変化を可視化する。
  • モデルが新しいタスクを学習した前後における活性化マップのインターセクション・オブ・ユニオン(IoU)を計算し、各層での忘却度を定量化する。
  • 各畳み込みブロックに対して、正解セグメンテーションとのIoUが最大となるフィルタを代表フィルタとして選定することで、計算コストを削減しつつ解釈可能性を維持する。
  • ResNet-50では5つの残差ブロックにわたる忘却を分析し、ブロック3および4が活性化シフトに対して最も感受性が高いことが判明した。
  • 臨界凍結は、Auto DeepVisで同定された最も感受性の高い層(例:ブロック3および4)のみを凍結する標的的正則化戦略として導入された。
  • デコーダーは、LSTM、埋め込み層、線形層といった個々のコンponentを別々に凍結することで、キャプション生成および忘却への寄与度を評価した。

実験結果

リサーチクエスチョン

  • RQ1継続的学習中に災難的忘却に最も寄与する具体的なコンponent(フィルタ、層、ブロック)はどれか?
  • RQ2モデルレベルやタスクレベルではなく、コンponentレベルでの忘却をどのように可視化・定量化できるか?
  • RQ3感受性の高い層を同定し、選択的に凍結することで、旧タスクおよび新タスクの両方でより良い性能が達成できるか?
  • RQ4LSTMや線形層などの異なるデコーダー部品は、画像キャプションモデルにおける忘却にどのように寄与しているか?
  • RQ5説明可能なAI技術(例:可視化)を活用することで、継続的学習アルゴリズムの設計がどの程度改善できるか?

主な発見

  • ResNet-50のブロック3およびブロック4は、初期のブロックと比較して顕著に活性化マップ間のIoUが低下し、最も深刻な忘却を示した。
  • ブロック3における$M_{24}$と$M_{19}$間のIoUが急激に低下しており、これが災難的忘却の主な発生源であることを示している。
  • 臨界凍結(感受性の高い層のみを凍結)は、旧タスクおよび新タスクの両方で最良の性能を達成し、ベースラインの凍結戦略を上回った。
  • 定性的な分析から、臨界凍結後も予測結果がほぼ同一であり、わずかな誤分類(例:アメリカオオカマス vs. クラッシャー)が一部見られたが、両者とも鳥に属する。
  • デコーダーのLSTM層を凍結した場合が最も優れた性能(BLEU1: 46.1, CIDEr: 12.8)を示したのに対し、線形層を凍結した場合はすべての指標が著しく低下した(BLEU1: 39.3, CIDEr: 4.2)。
  • 感受性層における知識蒸留は、時間経過とともに教師モデルと生徒モデルの乖離が蓄積されたため、効果が得られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。