Skip to main content
QUICK REVIEW

[論文レビュー] Ternary Feature Masks: continual learning without any forgetting

Marc Masana, Tinne Tuytelaars|arXiv (Cornell University)|Jan 23, 2020
Domain Adaptation and Few-Shot Learning参考文献 26被引用数 21
ひとこと要約

本稿では、重みではなく層の活性化に三値マスクを適用することで、災難的忘却を防ぐ継続的学習手法Ternary Feature Masksを提案する。これにより、最小限のメモリオーヘッドで効率的な知識再利用が可能になる。この手法は、細分化された画像データセットおよびImageNetにおいて、最先端の手法を上回る性能を発揮するとともに、パラメータの増加を3桁以上削減する。

ABSTRACT

In this paper, we propose an approach without any forgetting to continual learning for the task-aware regime, where at inference the task-label is known. By using ternary masks we can upgrade a model to new tasks, reusing knowledge from previous tasks while not forgetting anything about them. Using masks prevents both catastrophic forgetting and backward transfer. We argue -- and show experimentally -- that avoiding the former largely compensates for the lack of the latter, which is rarely observed in practice. In contrast to earlier works, our masks are applied to the features (activations) of each layer instead of the weights. This considerably reduces the number of mask parameters to be added for each new task; with more than three orders of magnitude for most networks. The encoding of the ternary masks into two bits per feature creates very little overhead to the network, avoiding scalability issues. Our masks do not permit any changes to features which are used by previous tasks. As this may be too restrictive to allow learning of new tasks, we add task-specific feature normalization. This way, already learned features can adapt to the current task without changing the behavior of these features for previous tasks. Extensive experiments on several finegrained datasets and ImageNet show that our method outperforms current state-of-the-art while reducing memory overhead in comparison to weight-based approaches.

研究の動機と目的

  • 推論時においてタスクの識別子が分かっているタスク認識設定における、継続的学習における災難的忘却の問題を解決すること。
  • 重みから特徴にマスク適用を移行させることで、継続的学習におけるメモリおよびパラメータのオーバーヘッドを低減すること。
  • バックワード伝搬が実際にはほとんど有益でない場合に、過去のタスクからの安定した知識保持を可能にすること。
  • 最小限のアーキテクチャ変更で、順次タスク間でモデル性能を維持できるスケーラブルで効率的な手法を設計すること。

提案手法

  • 本手法は、ネットワークの重みではなく、各層の特徴マップ(活性化)に三値マスク(値 ∈ {-1, 0, 1})を適用する。
  • 各マスクは、1つの特徴あたり2ビットで符号化されるため、重みベースのマスクと比較して必要なパラメータ数を著しく削減する(重みベースの手法と比較して3桁以上)。
  • マスクは、過去のタスクで使用された特徴を保持するように設計されており、特徴レベルの制約によって忘却が発生しないようにする。
  • 新しいタスクへの適応を可能にするために、タスク固有の特徴正規化が導入され、過去のタスクの挙動を変えることなく、学習された特徴が適応可能になる。
  • 本手法は、新しいタスク固有の特徴のみを変更するように制約し、過去に学習した表現はマスク機構によって固定されたままに保つ。

実験結果

リサーチクエスチョン

  • RQ1重みではなく特徴に作用させることで、完全に忘却のない継続的学習が達成可能か?
  • RQ2重みベースの手法と比較して、活性化に三値マスクを適用することで、メモリオーヘッドが著しく削減されるか?
  • RQ3実際の応用ではバックワード伝搬を無視でき、災難的忘却を回避するだけで優れた性能が得られるか?
  • RQ4タスク固有の正規化により、過去のタスクの知識を損なうことなく、新しいタスクへの適応が効果的に行えるか?

主な発見

  • 本手法は、細分化された画像分類データセットおよびImageNetにおいて、最先端の性能を達成し、既存の継続的学習手法を上回る。
  • 特徴レベルでのマスク適用のおかげで、重みベースのマスク手法と比較して、メモリオーヘッドが3桁以上削減された。
  • 1特徴あたり2ビットの三値マスクの使用により、計算およびストレージオーバーヘッドがほとんど無視できるほど小さくなり、スケーラビリティが向上する。
  • マスク機構により、新しいタスクに特有のコンponentsにのみ特徴の変更が制限されるため、災難的忘却は完全に防止される。
  • タスク固有の正規化により、過去のタスクの特徴挙動を変えることなく、新しいタスクへの適応が効果的に可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。