Skip to main content
QUICK REVIEW

[論文レビュー] REMIND Your Neural Network to Prevent Catastrophic Forgetting

Tyler L. Hayes, Kushal Kafle|arXiv (Cornell University)|Oct 6, 2019
Multimodal Machine Learning Applications参考文献 87被引用数 22
ひとこと要約

REMIND は、生のピクセルではなく圧縮・量子化された特徴表現を再放送することで、ニューラルネットワークにおける深刻な忘却を防ぐ、脳にインspiredされたオンライン学習フレームワークである。効率的なメモリインデクシングのための製品量子化(Product Quantization)を用い、REMIND はストリーミング学習において ImageNet で最先端の性能を達成し、既存手法を 21.9% 以上上回り、12 時間未塔の学習時間で実現した。これは、ストリーミング視覚質問応答(Visual Question Answering)などのタスクへの頑健さと一般化能力を示している。

ABSTRACT

People learn throughout life. However, incrementally updating conventional neural networks leads to catastrophic forgetting. A common remedy is replay, which is inspired by how the brain consolidates memory. Replay involves fine-tuning a network on a mixture of new and old instances. While there is neuroscientific evidence that the brain replays compressed memories, existing methods for convolutional networks replay raw images. Here, we propose REMIND, a brain-inspired approach that enables efficient replay with compressed representations. REMIND is trained in an online manner, meaning it learns one example at a time, which is closer to how humans learn. Under the same constraints, REMIND outperforms other methods for incremental class learning on the ImageNet ILSVRC-2012 dataset. We probe REMIND's robustness to data ordering schemes known to induce catastrophic forgetting. We demonstrate REMIND's generality by pioneering online learning for Visual Question Answering (VQA).

研究の動機と目的

  • 非 i.i.d. データストリーム上で学習する際、ニューラルネットワークが過去の知識を上書きしてしまう深刻な忘却を解消すること。
  • 脳における海馬のインデクシングと記憶再放送にインspiredされた生物学的に妥当な学習手法を開発すること。
  • 生の画像再放送ではなく、圧縮された表現を用いることで、メモリ制約下での効率的なオンライン学習を可能にすること。
  • 従来のオンライン学習で未解決であった、ストリーミング視覚質問応答(VQA)のような新規タスクへのアプローチの拡張。
  • ストリーミング VQA のための新しいベースラインと評価プロトコルを確立し、CLEVR および TDIUC データセットで優れた性能を示すこと。

提案手法

  • REMIND は、製品量子化(PQ)を用いて、隠れ特徴マップ(例:ResNet-18 からのもの)を圧縮・保存し、後続の再放送を可能にする。これにより、効率的なメモリインデクシングが実現される。
  • モデルは、1例ずつ順次更新するオンライン学習を実行し、人間のストリーミング学習に類似した挙動を再現する。
  • 学習中、REMIND は現在のデータと過去の経験からランダムに抽出された圧縮された特徴表現の混合物を用いて、ネットワークをファインチューニングする。
  • 再放送バッファはランダム交換によって更新され、大きな計算負荷を伴わず、固定サイズのメモリを維持する。
  • VQA の場合、REMIND は圧縮された視覚的・言語的特徴を再放送することで、ストリーミング入力間でマルチモーダル表現を保持する。
  • 本手法は、テスト時にタスクラベルに依存しないため、忘却を誘発するような現実世界のデータ順序に対しても頑健である。

実験結果

リサーチクエスチョン

  • RQ1ストリーミング学習において、生のピクセル再放送と比較して、高レベルの特徴表現を圧縮して再放送することで、深刻な忘却をより効果的に緩和できるか?
  • RQ2厳密なメモリおよび計算制約下で、REMIND は ImageNet においてバッチ法およびストリーミングベースラインと比較してどのように性能を発揮するか?
  • RQ3アーキテクチャの変更なしに、ストリーミング視覚質問応答(VQA)のようなマルチモーダルタスクへ一般化できるか?
  • RQ4クラスインクリメンタルまたはインスタンスインクリメンタルな順序でデータが提供される場合、忘却を誘発するシーケンスに対しても REMIND は頑健性を維持できるか?
  • RQ5バッチ法が 65 時間以上を要するのに対し、REMIND は 12 時間未塔で学習を完了させながら、オフラインのフルバッチ学習に近い性能を達成できるか?

主な発見

  • REMIND は、ストリーミング設定下で ImageNet においてトップ5精度 99.5% を達成し、最良のストリーミングベースラインを 21.9% 以上上回り、最良のバッチモデルからわずか 1.9% の差にとどまった。
  • CORe50 データセットでは、EWC や MAS、A-GEM といった正則化ベースの手法を上回った。タスクラベルが提供されない状況下でも、忘却に対する頑健性を示した。
  • ImageNet では、BiC という最先端のバッチ法が 65 時間を要するのに対し、REMIND は学習時間を 12 時間未塔にまで短縮した。
  • ストリーミング VQA では、CLEVR および TDIUC データセットで優れた性能を発揮し、新しいベースラインを確立し、画像分類を越えた一般化能力を示した。
  • クラス順序やインスタンス順序の異なるデータ順序シナリオにおいても、REMIND の性能は安定しており、忘却を誘発する順序に強いことが示された。
  • PQ を用いた圧縮表現の使用により、生のピクセル再放送に依存する手法と比較して、同じメモリ予算内ではるかに多くの経験を格納可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。