Skip to main content
QUICK REVIEW

[論文レビュー] Less-forgetful Learning for Domain Expansion in Deep Neural Networks

Heechul Jung, Jeongwoo Ju|arXiv (Cornell University)|Nov 16, 2017
Domain Adaptation and Few-Shot Learning参考文献 25被引用数 3
ひとこと要約

本稿では、古いデータにアクセスできない状況下でも、以前に学習したドメインの性能を維持しながら新しいドメインに適応できるようにする、より忘れにくい学習(LF)手法を提案する。この手法は、特徴レベルの知識蒸留と、古いドメインの表現を保存するための補助損失($\mathcal{L}_e$)という2つの新しい特性を用い、微調整、LwF、EWCに比べ優れた性能を達成した。画像分類ベンチマークにおいて、ドメイン拡張の文脈で有効であることが示された。

ABSTRACT

Expanding the domain that deep neural network has already learned without accessing old domain data is a challenging task because deep neural networks forget previously learned information when learning new data from a new domain. In this paper, we propose a less-forgetful learning method for the domain expansion scenario. While existing domain adaptation techniques solely focused on adapting to new domains, the proposed technique focuses on working well with both old and new domains without needing to know whether the input is from the old or new domain. First, we present two naive approaches which will be problematic, then we provide a new method using two proposed properties for less-forgetful learning. Finally, we prove the effectiveness of our method through experiments on image classification tasks. All datasets used in the paper, will be released on our website for someone's follow-up study.

研究の動機と目的

  • 古い学習データにアクセスできない状況下で、深層ニューラルネットワークにおける災難的忘却(catastrophic forgetting)の課題に対処すること。
  • モデルが以前に学習したドメインの知識を保持しながら、新しいドメインに適応できる継続的学習を実現すること。
  • 入力データが古いドメインか新しいドメインかを事前に知る必要がない状況でも、効果的に機能する手法を開発すること。
  • 新しい損失関数とアーキテクチャ的制約を用いて、古いドメインの特徴を安定的に保存することで、ドメイン拡張における一般化性能と安定性を向上させること。

提案手法

  • 忘れにくい学習のための2つの鍵となる特性を提案:(1) 古いドメインの表現を保存するための特徴レベルの知識蒸留、(2) 学習中の特徴空間の安定化を図る補助損失($\\mathcal{L}_e$)。
  • 交差エントロピー損失と$\mathcal{L}_e$を組み合わせた訓練目的を導入し、古いドメインと新しいドメインのサンプル間で特徴の一貫性を促進する。
  • 新しいドメインのデータのみで訓練される共有の特徴抽出器と分類器ヘッドを用い、知識蒸留により古いドメインの性能を維持する。
  • 古いデータにアクセスできないが、提案された損失関数と知識蒸留により古いドメインの性能を維持できる微調整設定で手法を適用する。
  • 古いドメインの特徴がよく混合され、区別がつかないようネットワークを設計し、$\mathcal{L}_e$によって災難的忘却を防ぐ。
  • MNIST、SVHN、CIFAR、ImageNetなどのデータセットを用い、スクラッチ学習と微調整の両方におけるアブレーションスタディを含め、画像分類タスクで手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1古いドメインの性能を維持しながら、新しいドメインのデータのみで学習した深層ニューラルネットワークは、そのドメインで性能を維持できるか?
  • RQ2古いデータや入力ドメインの事前知識が得られない状況下で、災難的忘却をどのように軽減できるか?
  • RQ3どのような損失関数とアーキテクチャ的要素が、ドメイン間で安定した特徴表現の保存を可能にするか?
  • RQ4提案手法は、順次的なドメイン適応を伴う継続的学習のシナリオに一般化可能か?
  • RQ5微調整、LwF、EWCと比較して、忘れにくい学習の性能(古いドメインと新しいドメインの精度)はどのように異なるか?

主な発見

  • 提案された忘れにくい(LF)学習手法は、微調整、LwF、EWCに比べ、古いドメインの性能を維持しながら新しいドメインに適応する点で優れた性能を示した。
  • MNIST ∪ SVHNベンチマークにおいて、LFは継続的学習で71.1%の分類率を達成し、微調整(67.18%)を大きく上回り、オフライン学習(78.16%)に近い性能を示した。
  • CIFARカラー ∪ グレースケール実験では、新しいドメイン(グレースケール)のデータでのスクラッチ学習が、両ドメインで同等の性能を達成した。これは、複雑なデータの一般化がドメイン間転送を向上させることを示唆している。
  • 新しいドメインのデータが限られている場合(例:ImageNetノーマル ∪ ダーク&ブライト)、スクラッチ学習では過学習が生じ、古いドメインの性能が著しく低下したが、LFは良好な一般化性能を維持した。
  • $\mathcal{L}_e$損失は特徴空間の安定化に効果的であり、顕著な変化を防ぎ、忘却を軽減した。古いドメインの特徴がよく混合されていることから、その有効性が裏付けられた。
  • 本手法は継続的学習に実用的である:10タスクの順次的CIFAR-10実験では、LFは71.1%の精度を達成し、過去のデータにアクセスできない状況下でも高い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。