Skip to main content
QUICK REVIEW

[論文レビュー] Continual Learning for Text Classification with Information Disentanglement Based Regularization

Yufan Huang, Yanzhe Zhang|arXiv (Cornell University)|Apr 12, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用数 4
ひとこと要約

本稿では、継続的テキスト分類のための情報分離に基づく正則化(IDBR)手法を提案する。この手法は、隠れ表現をタスク普遍的およびタスク固有の成分に分離し、長期的な知識を保持するための異なる正則化を適用することで、新しいタスクに対して柔軟性を保つ。実験の結果、5つのベンチマークデータセットにおいて、最先端のベースラインを上回る性能を示し、深刻な忘却の軽減が確認された。

ABSTRACT

Continual learning has become increasingly important as it enables NLP models to constantly learn and gain knowledge over time. Previous continual learning methods are mainly designed to preserve knowledge from previous tasks, without much emphasis on how to well generalize models to new tasks. In this work, we propose an information disentanglement based regularization method for continual learning on text classification. Our proposed method first disentangles text hidden spaces into representations that are generic to all tasks and representations specific to each individual task, and further regularizes these representations differently to better constrain the knowledge required to generalize. We also introduce two simple auxiliary tasks: next sentence prediction and task-id prediction, for learning better generic and specific representation spaces. Experiments conducted on large-scale benchmarks demonstrate the effectiveness of our method in continual text classification tasks with various sequences and lengths over state-of-the-art baselines. We have publicly released our code at https://github.com/GT-SALT/IDBR.

研究の動機と目的

  • 継続的テキスト分類における深刻な忘却を軽減するため、タスク普遍的およびタスク固有の知識を区別すること。
  • 過去のタスクからの知識を保持しつつ、新しいタスクへの一般化性能を向上させること。
  • リプレイベースの手法と比較して、メモリおよび学習のオーバーヘッドを低減すること。
  • 普遍的および固有の表現に対して異なる扱いを施す正則化戦略を構築し、最適な知識保持を実現すること。
  • 大規模なベンチマークにおいて、さまざまなタスク順序およびシーケンス長の下で有効性を実証すること。

提案手法

  • 補助タスクを用いて、BERTベースの隠れ表現をタスク普遍的およびタスク固有の成分に分離する。
  • 次文予測を用いてタスク普遍的表現を学習し、タスクID予測を用いてタスク固有の表現を学習する。
  • 異なる正則化制約を適用する:タスク普遍的空間には強い正則化、タスク固有の空間には軽い正則化を施し、安定性を確保する。
  • 過去のタスクから最も代表的な例を1%のみ保存するためのメモリ選択ルール(K-Means)を導入する。
  • 正則化と小さなエピソードメモリバッファを組み合わせることで、知識の回復を強化する。
  • 分類のためのデュアルブランチヘッドを用い、共有ヘッドとタスク固有ヘッドをそれぞれ普遍的および固有の表現に対応させる。

実験結果

リサーチクエスチョン

  • RQ1隠れ表現を普遍的および固有の成分に分離することで、テキスト分類における継続的学習が向上するか?
  • RQ2普遍的および固有の表現に異なる正則化強度を適用することで、深刻な忘却が軽減されるか?
  • RQ3次文予測やタスクID予測といった補助タスクが、効果的に分離を導くことができるか?
  • RQ4制限されたメモリ予算下で、K-Meansによるメモリ選択が性能にどのように影響するか?
  • RQ5本手法は、さまざまなタスク順序およびシーケンス長に一般化可能か?

主な発見

  • IDBRは5つのベンチマークで平均73.72%の精度を達成し、最先端の手法を上回った。
  • アブレーションスタディの結果、次文予測とタスクID予測の両方の補助タスクを組み合わせることで、最も高い性能向上が得られた。
  • 普遍的および固有の空間の両方における正則化が不可欠であり、特に普遍的空間に強い正則化を施すことで、忘却の軽減が顕著に向上した。
  • K-Meansによるメモリ選択は、ランダムサンプリングよりも性能を向上させ、特に困難なタスク順序において顕著だった。
  • IDBRを用いることで、忘却測定値が著しく低下し、5つのタスク後に平均2.89の忘却スコアを示した。これは、深刻な忘却の軽減を示している。
  • 本手法は、さまざまなタスクシーケンスおよび入力長においても強固な性能を維持しており、耐障害性と一般化性能が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。