Skip to main content
QUICK REVIEW

[論文レビュー] Improving Short Text Classification With Augmented Data Using GPT-3

Salvador Balkus, Donghui Yan|arXiv (Cornell University)|May 23, 2022
Topic Modeling被引用数 6
ひとこと要約

本研究では、GPT-3を用いて合成されたトレーニング例を生成し、小規模なデータセットにおける短いテキスト分類の性能向上を検討する。GPT-3によって生成された例を小規模なラベル付きデータセットに追加することで、GPT-3の分類エンドポイントは、ベースラインと最適化されたfew-shotプロンプティングの両方を上回り、正解率が31%向上(0.58から0.76)した。

ABSTRACT

GPT-3 is a large-scale natural language model developed by OpenAI that can perform many different tasks, including topic classification. Although researchers claim that it requires only a small number of in-context examples to learn a task, in practice GPT-3 requires these training examples to be either of exceptional quality or a higher quantity than easily created by hand. To address this issue, this study teaches GPT-3 to classify whether a question is related to data science by augmenting a small training set with additional examples generated by GPT-3 itself. This study compares two classifiers: the GPT-3 Classification Endpoint with augmented examples, and the GPT-3 Completion Endpoint with an optimal training set chosen using a genetic algorithm. We find that while the augmented Completion Endpoint achieves upwards of 80 percent validation accuracy, using the augmented Classification Endpoint yields more consistent accuracy on unseen examples. In this way, giving large-scale machine learning models like GPT-3 the ability to propose their own additional training examples can result in improved classification performance.

研究の動機と目的

  • 短いテキスト分類において、特にデータサイエンスの質問のようなニッチな分野では限られたラベル付きデータが課題となることを踏まえ、その課題に対処すること。
  • GPT-3が自分自身の性能を向上させるために、合成されたトレーニング例を用いたデータ拡張が可能かどうかを評価すること。
  • 2つのデータ拡張戦略を比較すること:分類エンドポイント用に例を増やす方法と、コンプリーションエンドポイント用に例の選択を最適化する方法。
  • GPT-3ベースの分類器が未学習で実世界の短いテキストデータに対して、どれほど頑健で一般化可能であるかを評価すること。
  • 高品質または大規模なデータセットが入手できない状況で、自己生成データがモデル性能を効果的に向上させられるかどうかを特定すること。

提案手法

  • 少数の例-ラベルペアを含むプロンプトを用いて、GPT-3のコンプリーションエンドポイントを用いて短いテキストを分類し、遺伝的アルゴリズムを用いて入力例を最適化した。
  • GPT-3のテキスト生成機能を活用し、元の小規模なデータセットを拡張する目的で1,000件の合成トレーニング例を生成した。
  • コンプリーションエンドポイントのfew-shot一般化性能を向上させるために、遺伝的アルゴリズムを用いて、最も効果的なトレーニング例のサブセットを繰り返し選択した。
  • 同じテストセットを用いて、拡張された分類エンドポイントと最適化されたコンプリーションエンドポイントの両方のモデルを訓練および評価した。
  • マサチューセッツ州アンダーソン大学のビッグデータ・クラブで収集した学生の質問の実世界データセットを用いて、検証およびテスト正答率を評価した。
  • 質問の真のトピック(例:「データ」、「その他」)を定義し、モデルの予測を評価するために、人間によるラベル付け済みのラベルを用いた。

実験結果

リサーチクエスチョン

  • RQ1GPT-3は、小規模な短いテキストデータセットにおける分類性能を向上させる高品質な合成トレーニング例を生成できるか?
  • RQ2GPT-3によって生成された例を用いたデータ拡張は、最適化された例を用いたfew-shotプロンプティングと比較して、未学習のテストデータに対してより一貫した性能を示すか?
  • RQ3拡張されたトレーニングデータを用いた場合、GPT-3の分類エンドポイントとコンプリーションエンドポイントの性能はどのように比較されるか?
  • RQ4データ品質とラベル付けの主観性が、短いテキスト分類タスクにおけるモデルの一般化に与える影響は何か?
  • RQ5遺伝的アルゴリズムを用いた例の選択は、コンプリーションエンドポイントのfew-shot学習性能を向上させることができるか、それとも検証データに過適合を引き起こすか?

主な発見

  • GPT-3によって生成された1,000件の例をトレーニングセットに追加することで、GPT-3分類エンドポイントの正答率はベースラインの0.58から0.76に上昇し、相対的に31%の向上を達成した。
  • 遺伝的アルゴリズムで最適化された例を用いたコンプリーションエンドポイントは、検証正答率が85%に達したが、テスト正答率は67%にとどまり、検証セットへの過適合が示された。
  • 拡張データを用いた分類エンドポイントは、最適化された例を用いたコンプリーションエンドポイントよりも、未学習のテスト例に対してより一貫した性能を示した。
  • GPT-3は、会議の開催日時やインターフェースのカスタマイズに関するような、曖昧または主観的なラベルを持つ質問に対して特に苦労し、頻繁に誤分類された。
  • 本研究では、GPT-3の分類専用エンドポイントを用いる場合、例の最適化よりも自己生成データ拡張がfew-shot学習においてより効果的であることが判明した。
  • 結果から、GPT-3とデータ拡張を組み合わせることで、特に分類エンドポイントを用いることで、高品質または大規模なデータセットが入手できない状況でも、NLPモデルの実用的導入が可能になることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。