Skip to main content
QUICK REVIEW

[論文レビュー] Learning without Forgetting

Zhizhong Li, Derek Hoiem|arXiv (Cornell University)|Jun 29, 2016
Domain Adaptation and Few-Shot Learning被引用数 9
ひとこと要約

本稿では、過去のタスクのデータにアクセスできない状況下でも、事前学習済みの畳み込みニューラルネットワーク(CNN)を新しいタスクに微調整可能にする、Learning without Forgetting(LwF)という手法を提案する。LwFは、過去のタスクの入力例に対するネットワーク出力応答を保持することで、性能を維持する。LwFは、共同学習と同等の性能を達成し、標準的な微調整や特徴抽出法よりも新しいタスクおよび古いタスクの両方で優れた性能を示す。結果として、継続的学習において、古いデータを保存せずとも、深刻な忘却を効果的に回避できる。

ABSTRACT

When building a unified vision system or gradually adding new capabilities to a system, the usual assumption is that training data for all tasks is always available. However, as the number of tasks grows, storing and retraining on such data becomes infeasible. A new problem arises where we add new capabilities to a Convolutional Neural Network (CNN), but the training data for its existing capabilities are unavailable. We propose our Learning without Forgetting method, which uses only new task data to train the network while preserving the original capabilities. Our method performs favorably compared to commonly used feature extraction and fine-tuning adaption techniques and performs similarly to multitask learning that uses original task data we assume unavailable. A more surprising observation is that Learning without Forgetting may be able to replace fine-tuning with similar old and new task datasets for improved new task performance.

研究の動機と目的

  • 過去の学習データが利用できない状況下で、深層学習における深刻な忘却を解消すること。
  • 以前に学習したタスクの性能を維持しつつ、新しいタスクを学習する手法を開発すること。
  • 新しいタスクの精度と古いタスクの保持性能の両面で、標準的な微調整法や特徴抽出法を上回ること。
  • 旧データの保存や再学習が不要な、効率的でスケーラブルな継続的学習を、視覚システムに実現すること。

提案手法

  • 本手法は、知識蒸留(knowledge distillation)を用いて、新しいタスクの学習中に、元のネットワークが過去のタスクの入力例に対して出力する応答を保持する。
  • 温度スケーリングを施した交差エントロピー損失を用いて、元のネットワークの出力ログティット(logits)を、過去のタスクデータ上で一致させる。
  • 共有畳み込み層は低い学習率で微調整され、タスク固有のヘッドは初期化から訓練される。
  • 本手法は、新しいタスクの識別性能を向上させる微調整と、古いタスクの保持を図る蒸留を組み合わせることで、完全な再学習を回避する。
  • 重みの変化を制約するのではなく、出力挙動そのものを直接制約することで、パラメータ正則化を回避する。
  • 本手法は、旧データを必要とせず、新しいタスクのデータのみを用いてエンドツーエンドの学習に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1CNNは、過去の学習データにアクセスできない状況下でも、新しい視覚的タスクを学習しながら、古いタスクの性能を維持できるか?
  • RQ2過去のタスクの入力例に対する出力応答を保持することで、標準的な微調整法よりも新しいタスクおよび古いタスクの両方の性能が向上するか?
  • RQ3ソフトラベルを用いた知識蒸留は、継続的学習の文脈で、深刻な忘却を効果的に防げるか?
  • RQ4LwFは、共同学習や特徴抽出法と比較して、精度および効率性の面でどのように差をつけるか?
  • RQ5LwFは、標準的な微調整の代替手段として、新しいタスクの性能を向上させることができるか?

主な発見

  • LwFは、低学習率を用いた微調整でさえも、特徴抽出法や標準的な微調整法よりも新しいタスクの性能を顕著に上回る。
  • 標準的な微調整法が深刻な忘却を引き起こすのに対し、LwFは、古いタスクの性能を著しく良好に維持する。
  • 本手法は、すべてのタスクデータを必要とする共同学習に近い性能を達成するが、学習には新しいタスクのデータのみを用いる。
  • 温度スケーリング(T=2)を用いた知識蒸留は、L1、L2、交差エントロピー損失よりも、応答保持の観点でわずかに優れた性能を示す。
  • 共有層の学習率を下げるだけでは、古いタスクの性能低下を防げないため、出力に基づく正則化の必要性が示された。
  • LwFは、標準的な微調整に置き換えても、新しいタスクの精度を向上させるため、現在の実践手法に優る代替手段として機能することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。