Skip to main content
QUICK REVIEW

[論文レビュー] Guiding Generative Language Models for Data Augmentation in Few-Shot Text Classification

Aleksandra Edwards, Asahi Ushio|arXiv (Cornell University)|Nov 17, 2021
Topic Modeling被引用数 5
ひとこと要約

本稿では、少数-shotテキスト分類におけるデータ拡張のため、生成されたデータの品質と分類器の性能を向上させるために、戦略的にシード例を選択することでGPT-2をガイドする手法を提案する。実験の結果、特に保護報告のような専門的分野において、熟練者によるシード選択はランダムまたはヒューリスティックベースの手法を著しく上回り、ベースラインを常に上回る性能向上を達成するとともに、リource集約的な生成タスクにおける効率性も向上することが示された。

ABSTRACT

Data augmentation techniques are widely used for enhancing the performance of machine learning models by tackling class imbalance issues and data sparsity. State-of-the-art generative language models have been shown to provide significant gains across different NLP tasks. However, their applicability to data augmentation for text classification tasks in few-shot settings have not been fully explored, especially for specialised domains. In this paper, we leverage GPT-2 (Radford A et al, 2019) for generating artificial training instances in order to improve classification performance. Our aim is to analyse the impact the selection process of seed training examples have over the quality of GPT-generated samples and consequently the classifier performance. We perform experiments with several seed selection strategies that, among others, exploit class hierarchical structures and domain expert selection. Our results show that fine-tuning GPT-2 in a handful of label instances leads to consistent classification improvements and outperform competitive baselines. Finally, we show that guiding this process through domain expert selection can lead to further improvements, which opens up interesting research avenues for combining generative models and active learning.

研究の動機と目的

  • 専門的分野で熟練者によるアノテーションが求められる状況における、データスパarsityとクラス不均衡の問題に対処すること。
  • シード選択戦略がGPT-2が生成するトレーニングインスタンスの品質および下流分類器の性能に与える影響を調査すること。
  • 人間によるフィードバックを組み込んだシード選択、階層的構造の活用、名詞頻度ベースの選択戦略が、データ拡張の質を向上させる有効性を評価すること。
  • 少数のラベル付き例に対してGPT-2をラベル保持型で微調整することで、全データセットで微調整する手法を上回る性能が得られることを示すこと。
  • アクティブラーニングと生成モデルの統合が、リソースが限られた、熟練者依存の分野における効率的で高品質なデータ拡張を実現する可能性を探索すること。

提案手法

  • 各クラスごとに、わずか数個のラベル付きインスタンスのみを用いてGPT-2を微調整し、テキスト生成中にクラス情報を保持する。
  • ドメインエキスパートが代表的でクラスを示すトレーニング例を選択する人間によるフィードバックを組み込んだシード選択プロセスを実装する。
  • エキスパートが生成したデータセットの階層的構造に基づくシード選択戦略を開発し、上位クラス分類の性能を向上させる。
  • 名詞の頻度に基づく手法を採用し、語彙的豊かさが高いとされる用語を含むシードを選択することで、クラス識別に寄与すると仮定する。
  • 選択されたシードをプロンプトとして用い、合成されたトレーニングデータを生成し、拡張されたデータセットで分類器を微調整する。
  • 文レベルおよびパassageレベルの分類タスクにおいて、ランダムなシード選択、ヒューリスティックベースの戦略、エキスパートがガイドする選択戦略のパフォーマンスを比較する。

実験結果

リサーチクエスチョン

  • RQ1少数ショットテキスト分類において、異なるシード選択戦略が生成されたトレーニングデータの品質にどのように影響するか?
  • RQ2専門的分野において、熟練者によるシード選択は、ランダムまたはヒューリスティックベースの選択に比べて分類器の性能を向上させることができるか?
  • RQ3各クラスに対してわずか数個のラベル付き例でのみGPT-2を微調整することで、全データセットで微調整する手法を上回る性能が得られるか?
  • RQ4リソース集約的な生成モデルを用いた際、シード選択戦略がデータ拡張の効率性と有効性にどのように影響するか?
  • RQ5アクティブラーニングと生成モデルを組み合わせることで、リソースが限られた、熟練者依存の分野におけるデータ拡張がどの程度向上するか?

主な発見

  • 人間によるフィードバックを組み込んだシード選択戦略は、文レベルおよびパassageレベルの分類タスクにおいて、他のすべてのシード選択手法およびベースラインを著しく上回った。
  • 各クラスに対してわずか数個のラベル付きインスタンスでのみGPT-2を微調整することで、一貫したパフォーマンス向上が得られ、全データセットで微調整したモデルを上回った。
  • エキスパートが生成したクラス階層に基づくシード選択は、特に構造的・主題的特徴を持つ分野において、上位クラス分類の性能を向上させた。
  • 名詞頻度ベースのシード選択は測定可能な利点を示したが、エキスパートがガイドする選択に比べてやや弱く、語彙的豊かさがクラス識別的コンテンツの有用な代理指標であることが示唆された。
  • 20 Newsgroupsのような一般ドメインのデータセットではランダムなシード選択が十分であったが、保護報告のような専門的分野では無効であった。これは、ドメイン依存性が顕著であることを示している。
  • 本研究は、熟練者知識をテキスト生成パイプラインに統合することで、特に高リスクでリソースが限られた分野において、データ拡張の質と効率性が向上することを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。