Skip to main content
QUICK REVIEW

[論文レビュー] CLUES: Few-Shot Learning Evaluation in Natural Language Understanding

Subhabrata Mukherjee, Xiaodong Liu|arXiv (Cornell University)|Nov 4, 2021
Natural Language Processing Techniques被引用数 6
ひとこと要約

CLUESは、少样本自然言語理解(NLU)パフォーマンスを評価するための標準化されたベンチマークを導入し、さまざまなタスク(例:NER、MRC、分類)を一様な「スパンの集合」抽出タスクに定式化することで、評価の統一を図る。この研究では、特に複雑なタスクにおいて、人間とすべてのNLUモデルとの間で顕著なパフォーマンス格差が確認され、少サンプル一般化性能の向上がNLUモデルにおいて不可欠であることが示された。

ABSTRACT

Most recent progress in natural language understanding (NLU) has been driven, in part, by benchmarks such as GLUE, SuperGLUE, SQuAD, etc. In fact, many NLU models have now matched or exceeded "human-level" performance on many tasks in these benchmarks. Most of these benchmarks, however, give models access to relatively large amounts of labeled data for training. As such, the models are provided far more data than required by humans to achieve strong performance. That has motivated a line of work that focuses on improving few-shot learning performance of NLU models. However, there is a lack of standardized evaluation benchmarks for few-shot NLU resulting in different experimental settings in different papers. To help accelerate this line of work, we introduce CLUES (Constrained Language Understanding Evaluation Standard), a benchmark for evaluating the few-shot learning capabilities of NLU models. We demonstrate that while recent models reach human performance when they have access to large amounts of labeled data, there is a huge gap in performance in the few-shot setting for most tasks. We also demonstrate differences between alternative model families and adaptation techniques in the few shot setting. Finally, we discuss several principles and choices in designing the experimental settings for evaluating the true few-shot learning performance and suggest a unified standardized approach to few-shot learning evaluation. We aim to encourage research on NLU models that can generalize to new tasks with a small number of examples. Code and data for CLUES are available at https://github.com/microsoft/CLUES.

研究の動機と目的

  • 少サンプルNLUのための標準化された評価ベンチマークの欠如が、モデルや手法間の公平な比較を妨げている問題に対処する。
  • 人間と機械のパフォーマンスを、同一の少サンプル条件下で公平に比較できる統一された評価フレームワークを構築する。
  • 文書分類にとどまらず、名前付きエンティティ認識、読解理解、シーケンスラベル付けなどの多様なNLUタスクを含める。
  • 与えられたラベル付き例が非常に少ない状況において、現在の事前学習済み言語モデル(PLM)が人間のパフォーマンスに著しく劣ることを示す。
  • ばらつきに配慮したトレーニング分割と検証データの漏洩を回避するなど、信頼性のある少サンプル評価のための設計原則を確立する。

提案手法

  • すべてのNLUタスクを「スパンの集合」抽出タスクとして定式化することで、異なるタスクタイプ間での評価を統一し、1つのメトリクスで測定可能にする。
  • 各少サンプル設定(k=10, 20, 30)に対して5つの異なるランダムな分割を用い、モデルのばらつきとロバストネスを測定する。
  • BERT、RoBERTa、DeBERTa、T5など複数のモデルファミリーと、ファインチューニング、プロンプトチューニング、イン・コンテキスト・ラーニング(GPT-3)といった適応手法を評価する。
  • トレーニング中に保持済みの検証セットを排除することで、評価の真の少サンプル性を保ち、ハイパーパramータチューニングに起因するアーティファクトを回避する。
  • モデルパフォーマンスとの直接比較を可能にするために、同一の少サンプルおよびゼロショット設定下で人間のパフォーマンスデータを収集する。
  • タスクの多様性と複雑さを考慮してベンチマークを設計し、人間とモデルとの間で明確なパフォーマンス格差を確保する。

実験結果

リサーチクエスチョン

  • RQ1現在の事前学習済み言語モデル(PLM)は、多様な少サンプルNLUタスクにおいて、人間のパフォーマンスと比べてどの程度の性能を示すのか?
  • RQ2モデルアーキテクチャ、サイズ、適応手法(例:ファインチューニング対プロンプトチューニング)が少サンプルNLUパフォーマンスに与える影響は何か?
  • RQ3モデルのばらつきが少サンプルパフォーマンスに与える影響はどの程度で、どのように信頼性を持って測定できるか?
  • RQ4複雑なタスク(例:MRC、NER)を含めることで、少サンプル設定下における人間とモデルとのパフォーマンス格差はどのように変化するか?
  • RQ5標準化され、公平で信頼性のある少サンプルNLU評価ベンチマークを構築するための設計原則は何か?

主な発見

  • 人間はわずかなラベル付き例(例:10ショットでCoNLL03 NERで87.7 F1)でのみでも高いパフォーマンスを達成し、優れた少サンプル一般化能力を示している。
  • 評価されたすべてのPLM(例:BERT Base、RoBERTa Large)は、少サンプル設定下でNERやMRCタスクで著しく低いパフォーマンスを示している。例として、BERT Baseは10ショットでCoNLL03で51.3 F1にとどまり、人間のパフォーマンスに大きく劣っている。
  • 人間とモデルとのパフォーマンス格差は、NER や MRC のような複雑なタスクで最も顕著であり、モデルのパフォーマンスはランダムに近い(例:10ショットでReCoRDで10.3 F1)状態に近い。
  • 少サンプルファインチューニングではモデルのばらつきが大きく、特に大きなモデルにおいて顕著で、異なるランダムシードやショット分割によってパフォーマンスが著しく変動する。
  • トレーニング中に検証セットを使用すると、SST-2ではパフォーマンスが約7%向上する(例:76.3から83.0 F1に)。これは、評価におけるデータ漏洩のリスクを浮き彫りにしている。
  • プロンプトベースのファインチューニングは、フルファインチューニングよりもばらつきが小さく、少サンプル適応においてより安定している可能性があるが、依然として人間レベルのパフォーマンスには遠く及ばない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。