Skip to main content
QUICK REVIEW

[論文レビュー] Grad2Task: Improved Few-shot Text Classification Using Gradients for Task Representation

Jixuan Wang, Kuan-Chieh Wang|arXiv (Cornell University)|Jan 27, 2022
Topic Modeling被引用数 10
ひとこと要約

本稿では、ベースモデルの勾配情報を用いてタスクを表現する新しい少样本テキスト分類手法Grad2Taskを提案する。この手法により、微調整されたBERTベースの分類器の効率的適応が可能となる。アダプタモジュールをこれらの勾配に基づくタスク表現に条件づけることで、多様な少样本テキスト分類タスクにおいて最先端の性能を達成し、従来の微調整や逐次的転移学習、メタラーニングのベースラインを上回る。

ABSTRACT

Large pretrained language models (LMs) like BERT have improved performance in many disparate natural language processing (NLP) tasks. However, fine tuning such models requires a large number of training examples for each target task. Simultaneously, many realistic NLP problems are "few shot", without a sufficiently large training set. In this work, we propose a novel conditional neural process-based approach for few-shot text classification that learns to transfer from other diverse tasks with rich annotation. Our key idea is to represent each task using gradient information from a base model and to train an adaptation network that modulates a text classifier conditioned on the task representation. While previous task-aware few-shot learners represent tasks by input encoding, our novel task representation is more powerful, as the gradient captures input-output relationships of a task. Experimental results show that our approach outperforms traditional fine-tuning, sequential transfer learning, and state-of-the-art meta learning approaches on a collection of diverse few-shot tasks. We further conducted analysis and ablations to justify our design choices.

研究の動機と目的

  • 分類ごとのラベル付き例が極めて限られている少样本テキスト分類の課題に対処すること。
  • 入力符号化よりも表現力の高いタスク表現としての勾配情報を利用することで、少样本学習における一般化性能を向上させること。
  • ラベルの意味や構造が異なる多様なソースタスクからの効果的転移を可能にすること。
  • 事前学習されたBERTモデル内にアダプタモジュールを用いて、効率的かつパラメータ効率の良い適応メカニズムを開発すること。
  • 少样本テキスト分類ベンチマークにおいて、従来の微調整、逐次的転移学習、メタラーニング手法を上回ること。

提案手法

  • 少数のサポートセット上でモデルパラメータに関する損失関数の全勾配を用いてタスク表現を構築し、入力と出力の関係を捉える。
  • 条件付きニューラルプロセス(CNAP)フレームワークを採用し、適応ネットワークが勾配に基づくタスク埋め込みに応じてアダプタパラメータを変調する。
  • 効率性とパラメータ共有を維持するため、ボトルネックアダプタモジュールを備えた事前学習済みBERTを特徴抽出器として使用する。
  • ラベルをテキストトークンとして扱い、BERTを用いて符号化し、入力および勾配特徴と組み合わせてタスク表現の一部とする。
  • 適応ネットワークがアダプタ層のスケーリングおよびシフトパラメータを生成し、推論時に高速かつタスク固有の適応を可能にする。
  • サポートセット上でクロスエントロピー損失を用いてエンドツーエンドに学習し、勾配に基づくタスク特徴を適応ネットワークの条件付けに使用する。

実験結果

リサーチクエスチョン

  • RQ1入力に基づくタスク表現を超えて、勾配に基づく表現が少样本テキスト分類を改善できるか?
  • RQ2タスク埋め込みとしての勾配情報の使用が、構造的に異なる多様なテキスト分類タスクにおいてより良い一般化をもたらすか?
  • RQ3本手法は、従来の微調整および最先端のメタラーニングアプローチと比較して、少样本設定でどのように性能を発揮するか?
  • RQ4すべてのトークンではなく[CLS]トークンのみを変調するという設計選択が、モデル性能にどのような影響を及えるか?
  • RQ5ハイパーネットワークベースのパラメータ生成アプローチは、本手法の適応メカニズムを上回れるか?

主な発見

  • Grad2Taskは10の多様な少样本テキスト分類タスクにおいて平均45.83%の正確度を達成し、従来の微調整および逐次的転移学習を上回った。
  • CNAPを含む最先端のメタラーニングベースラインを大きく上回り、次に良いベースラインより1.2%の絶対的向上を示した。
  • 入力符号化やラベル符号化のみを用いる場合に比べ、勾配に基づくタスク表現が優れた性能を発揮した。アブレーションスタディでは、勾配を平均入力埋め込みに置き換えた場合に1.5%の低下が確認された。
  • [CLS]トークンの表現のみを変調する場合、全トークンの適応に比べて性能が劣り(44.57%)、全系列の適応の重要性を示している。
  • ハイパーネットワークベースのパラメータ生成アプローチは44.79%の正確度を達成したが、Grad2Taskに劣っており、アダプタパラメータの直接的適応がより効果的で、過学習のリスクも低いことが示唆された。
  • タスク埋め込みモデルを事前学習すると45.68%の正確度が得られたが、本手法よりわずかに劣っており、この設定ではエンドツーエンド学習がより効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。