Skip to main content
QUICK REVIEW

[論文レビュー] Task Contamination: Language Models May Not Be Few-Shot Anymore

Changmao Li, Jeffrey Flanigan|arXiv (Cornell University)|Dec 26, 2023
Topic Modeling被引用数 6
ひとこと要約

この論文は、大規模言語モデル(LLMs)におけるタスク汚染を調査し、ゼロショットおよびフェイントショット性能の向上が、しばしば事前学習中にタスク例にさらされたためであり、真のフェイントショット一般化によるものではないことを示している。時間順のデータセットを用いたモデル評価、学習データの検査、例の抽出、メンバーシップインファレンスを用いて、著者らは、事前学習時代のデータセットに対してモデルが顕著に高い性能を示すことを示しており、抽出可能な学習例と性能向上の間には強い相関関係があることが判明した—特にGPT-3シリーズのモデルにおいて顕著である。

ABSTRACT

Large language models (LLMs) offer impressive performance in various zero-shot and few-shot tasks. However, their success in zero-shot and few-shot settings may be affected by task contamination, a potential limitation that has not been thoroughly examined. This paper investigates how zero-shot and few-shot performance of LLMs has changed chronologically over time. Utilizing GPT-3 series models and several other recent open-sourced LLMs, and controlling for dataset difficulty, we find that on datasets released before the LLM training data creation date, LLMs perform surprisingly better than on datasets released after. This strongly indicates that, for many LLMs, there exists task contamination on zero-shot and few-shot evaluation for datasets released prior to the LLMs' training data creation date. Additionally, we utilize training data inspection, task example extraction, and a membership inference attack, which reveal further evidence of task contamination. Importantly, we find that for classification tasks with no possibility of task contamination, LLMs rarely demonstrate statistically significant improvements over simple majority baselines, in both zero and few-shot settings.

研究の動機と目的

  • 大規模言語モデル(LLMs)の強力なゼロショットおよびフェイントショット性能が、事前学習データからのタスク汚染に起因しているかどうかを調査すること。
  • LLMの事前学習データ収集日付に対して、データセットのリリース日付の時間的影響を体系的に分析すること。
  • 複数の手法(学習データの検査、タスク例の抽出、メンバーシップインファレンス攻撃)を用いて、タスク汚染の実証的証拠を提供すること。
  • LLMsがフェイントショット設定で真に一般化しているのか、それとも事前学習済みの例を想起しているだけなのかを評価すること。
  • モデルの学習データに関する透明性を提唱し、汚染の影響によりフェイントショット能力を過大評価するのを避けるよう警告すること。

提案手法

  • 12のLLMs(GPT-3シリーズおよびオープンソースモデルを含む)を17のタスクで時間的順序評価し、モデルの事前学習データ収集日付より前・後にリリースされたデータセットの性能を比較した。
  • 事前学習コーパスに正確または類似する複製のタスク例が存在するかを確認するための学習データの検査。
  • 指示微調整済みモデルからタスク例を抽出し、学習例が記憶され、再取得可能かどうかを特定した。
  • スパムの意味解析タスク(Spider)におけるメンバーシップインファレンス攻撃を実施し、モデルの予測が事前学習データにタスク例が存在するかどうかと相関しているかをテストした。
  • 多数派ベースラインに対する性能向上の統計的分析を実施し、99%信頼水準での有意性検定を実施した。
  • 抽出可能な学習例の数と、下流タスクにおけるモデルの正確性との間の相関分析を実施した。
(a) GPT-3 series on pre-collection datasets
(a) GPT-3 series on pre-collection datasets

実験結果

リサーチクエスチョン

  • RQ1事前学習データにおけるタスク汚染が、LLMsの高いゼロショットおよびフェイントショット性能を説明する程度はどの程度か?
  • RQ2モデルの事前学習データ収集日付より前・後にリリースされたデータセットにおけるLLMsの性能は、どのように比較されるか?
  • RQ3指示微調整済みLLMsからタスク例を抽出できるか?また、抽出可能な例の数とモデルの性能には相関があるか?
  • RQ4タスク汚染の可能性がない分類タスクにおいて、LLMsは多数派ベースラインよりも統計的に有意に優れた性能を示すか?
  • RQ5抽出可能な学習例の数と、モデルの下流タスクにおける正確性との間に測定可能な関連性はあるか?

主な発見

  • LLMsは、事前学習データ収集日付より前にリリースされたデータセットに対して、その後のデータセットよりも顕著に高い性能を示しており、タスク汚染が原因であると示唆している。
  • タスク汚染の可能性がない分類タスクにおいて、LLMsはゼロショットまたはフェイントショット設定で多数派ベースラインよりも統計的に有意に優れた性能を示すことはめったになく、稀である。
  • 抽出可能な学習例の数と、Spider意味解析タスクにおけるモデル正確性との間に強い相関(R = .88)が確認された。
  • GPT-3シリーズのモデルにおいて、davinciからGPT-3.5-turboにかけて、抽出可能な学習例の数が増加しており、同じタスクにおけるゼロショット性能の上昇と密接に一致している。
  • 学習データの検査と例の抽出は、閉鎖型のGPT-3やオープンソースモデル(LLaMAやVicunaなど)を含む複数のモデルで、タスク汚染の一貫した証拠を提供している。
  • メンバーシップインファレンス攻撃により、特定のタスクにおけるモデルの性能が、事前学習段階でのタスク例への露出に強く影響を受けており、一般化能力によるものではないことが確認された。
(b) GPT-3 series on post-collection datasets
(b) GPT-3 series on post-collection datasets

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。