Skip to main content
QUICK REVIEW

[論文レビュー] Continual Feature Selection: Spurious Features in Continual Learning

Timothée Lesort|arXiv (Cornell University)|Mar 2, 2022
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、継続的学習における誤った特徴量および局所的誤った特徴量を調査し、データ分布のシフトやデータアクセスの制限により、モデルが一般化不能な特徴量に依存する傾向にあることを示している。性能低下は、崩壊的忘却(catastrophic forgetting)に起因するだけでなく、局所的誤った特徴量への過学習にも起因することを示し、この問題を緩和するためのリプレイベースの手法を提案している。

ABSTRACT

Continual Learning (CL) is the research field addressing learning without forgetting when the data distribution is not static. This paper studies spurious features' influence on continual learning algorithms. We show that continual learning algorithms solve tasks by selecting features that are not generalizable. Our experiments highlight that continual learning algorithms face two related problems: (1) spurious features and (2) local spurious features. The first one is due to a covariate shift between training and testing data, while the second is due to the limited access to data at each training step. We study (1) through a consistent set of continual learning experiments varying spurious correlation amount and data distribution support. We show that (2) is a major cause of performance decrease in continual learning along with catastrophic forgetting. This paper presents a different way of understanding performance decrease in continual learning by highlighting the influence of (local) spurious features in algorithms capabilities.

研究の動機と目的

  • 誤った特徴量(一般化しない特徴量とラベルの相関)が継続的学習アルゴリズムに与える影響を調査すること。
  • 継続的学習における新たな問題を同定・分析すること:各学習ステップでデータが不完全に提供されることによって生じる、局所的誤った特徴量。
  • 特にリハーサルを含む既存の継続的学習手法が、誤った特徴量および局所的誤った特徴量に及ぼす悪影響を効果的に緩和できるかどうかを評価すること。
  • 継続的学習に特化した修正版のOut-of-Distribution (OOD) 一般化手法を提案し、新しいベンチマーク上でその性能を評価すること。
  • 継続的学習における性能低下を、崩壊的忘却だけでなく、特徴量選択の誤りに起因すると再定式化すること。

提案手法

  • 制御されたデータ分布のシフトを伴う、色付きMNISTを模したSpuriousCIFAR2と呼ばれる新しい継続的学習ベンチマークを提案し、誤った相関を体系的かつ制御的に調査する。
  • 訓練データとテストデータの分布に共変量シフトを模倣するため、色を誤った特徴量として使用する2値分類設定を採用する。
  • 継続的学習に適応した修正版のOOD一般化手法を導入し、不変で誤った特徴量でない特徴量を学習することを目的とする。
  • 特徴量選択が一般化に与える影響を分離するために、シングルヘッドおよびマルチヘッド分類器の両方を用いて性能を比較する。
  • 重み正規化を有無にかかわらず、線形層および平均層分類器を用い、特徴量選択バイアスまたは正規化の不均衡が性能差を誘発するかどうかを評価する。
  • リハーサルベースの継続的学習手法を適用し、タスク間でi.i.d.データ分布を模倣することで、局所的誤った特徴量の学習リスクを低減する。

実験結果

リサーチクエスチョン

  • RQ1継続的学習アルゴリズムは、訓練データとテストデータの間の共変量シフトにより、どれほど誤った特徴量に過学習するのか?
  • RQ2局所的誤った特徴量(特定のタスク内ではラベルと相関するが、全シナリオ全体では相関しない特徴量)の存在が、継続的学習の性能にどのように影響するのか?
  • RQ3リハーサルのような標準的な継続的学習手法は、誤った特徴量および局所的誤った特徴量に及ぼす悪影響を効果的に緩和できるか?
  • RQ4継続的学習における性能低下は、主に崩壊的忘却に起因するのか、それとも、局所的誤った特徴量に依存するような悪い特徴量選択の意思決定が大きな役割を果たすのか?
  • RQ5OOD一般化技術は、継続的学習に適応させ、効果的に適用可能か?

主な発見

  • 継続的学習モデルは、訓練データではラベルと相関するが、テストデータでは相関しない誤った特徴量に頻繁に依存しており、その結果、一般化性能が著しく低下する。
  • シングルヘッド分類器とマルチヘッド分類器の性能差は、線形層では顕著に大きいが、平均層ではそれほど大きくないため、性能低下の主因はモデルアーキテクチャではなく、特徴量選択バイアスであると示唆される。
  • 事前学習済みモデルは、局所的誤った特徴量の問題を軽減しない。強力な特徴抽出器だけでは、継続的学習における耐障害性を確保できないことが示された。
  • リプレイ手法は、タスク間でi.i.d.データ分布を模倣することで、局所的誤った特徴量の学習リスクを効果的に低減する。
  • 継続的学習における性能低下は、崩壊的忘却に起因するだけでなく、局所的誤った特徴量への過学習が顕著に悪化要因となっている。
  • 本研究では、局所的誤った特徴量が、崩壊的忘却と同等の核心的課題であると特定し、単なる記憶保持を超えて特徴量選択を重視する新しい手法の開発を要請している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。