Skip to main content
QUICK REVIEW

[論文レビュー] Downstream Datasets Make Surprisingly Good Pretraining Corpora

K. Siva Krishna, Saurabh Garg|arXiv (Cornell University)|Sep 28, 2022
Natural Language Processing Techniques被引用数 7
ひとこと要約

この論文は、自己自己教師あり学習(self-pretraining)を提案する。これは、標準的な自己教師あり目的(例:マスキング言語モデル)を用いて、下流タスクのデータそのものに対してトランスフォーマー・モデルを事前学習する手法である。本手法は、BookWikiなどの大規模な上流コーパスで標準的な事前学習を行う手法と同等またはそれを上回る性能を示しており、質問応答や共通認識推論などのタスクで50–80%の性能向上を達成している。さらに、10個のデータセットのうち7つで市販のモデルを上回っている。これは、事前学習の恩恵が主に目的自体に起因しており、外部のデータに起因するものではないことを示唆している。

ABSTRACT

For most natural language processing tasks, the dominant practice is to finetune large pretrained transformer models (e.g., BERT) using smaller downstream datasets. Despite the success of this approach, it remains unclear to what extent these gains are attributable to the massive background corpora employed for pretraining versus to the pretraining objectives themselves. This paper introduces a large-scale study of self-pretraining, where the same (downstream) training data is used for both pretraining and finetuning. In experiments addressing both ELECTRA and RoBERTa models and 10 distinct downstream classification datasets, we observe that self-pretraining rivals standard pretraining on the BookWiki corpus (despite using around $10 imes$--$500 imes$ less data), outperforming the latter on $7$ and $5$ datasets, respectively. Surprisingly, these task-specific pretrained models often perform well on other tasks, including the GLUE benchmark. Besides classification tasks, self-pretraining also provides benefits on structured output prediction tasks such as span based question answering and commonsense inference, often providing more than $50\%$ of the performance boosts provided by pretraining on the BookWiki corpus. Our results hint that in many scenarios, performance gains attributable to pretraining are driven primarily by the pretraining objective itself and are not always attributable to the use of external pretraining data in massive amounts. These findings are especially relevant in light of concerns about intellectual property and offensive content in web-scale pretraining data.

研究の動機と目的

  • 事前学習による性能向上が、主に事前学習目的に起因するのか、それとも上流コーパスの規模や内容に起因するのかを調査すること。
  • 標準的な自己教師あり目的を用いる場合、下流コーパスそのものが有効な事前学習コーパスとして機能できるかどうかを評価すること。
  • 下流データで事前学習する自己自己教師あり学習(SP)と、大規模な上流コーパスで事前学習する標準的な事前学習(ST)を、多様なNLPタスクにおいて比較すること。
  • 自己自己教師あり学習で事前学習されたモデルが、GLUEや構造化予測タスクを含む他の下流タスクにも一般化できるかどうかを評価すること。
  • 自己自己教師あり学習が、事前学習データにおける有害コンテンツへの露出を低減する上でどのような意味を持つのかを検討すること。

提案手法

  • 著者らは、微調整に使用する同じ下流データセットを事前学習にも用いることで、ELECTRAおよびRoBERTaモデルを自己自己教師あり学習で微調整した。
  • 事前学習段階では、マスキング言語モデル(MLM)や置換トークン検出(RTD)といった標準的な自己教師あり目的を適用した。
  • SQuAD、SWAG、HellaSwag、およびCONLL-2012 NERを含む10個の多様な下流分類データセットで性能を評価した。
  • 3つの訓練方式を比較した:ランダム初期化(RI)、自己自己教師あり学習(SP)、BookWiki上で実施された市販の事前学習(OS)。
  • 各モデルとデータセットについて、F1スコアとランダム初期化に対するF1スコアの向上率を報告した。
  • 自己自己教師あり学習モデルと市販モデルの間の誤り相関を分析し、異なる事前学習戦略が補完的な予測をもたらすかどうかを評価した。

実験結果

リサーチクエスチョン

  • RQ1NLPにおける性能向上は、主に事前学習目的に起因するのか、それとも上流コーパスの規模や内容に起因するのか。
  • RQ2下流コーパスそのものが、大規模な上流コーパスと同等またはそれ以上の性能を達成できる有効な事前学習コーパスとして機能できるのか。
  • RQ3多様なNLPタスクにおいて、自己自己教師あり学習は標準的な事前学習と比較して、下流タスクの性能でどのように差がつくのか。
  • RQ4自己自己教師あり学習で事前学習されたモデルは、その事前学習ドメイン外の他の下流タスクに対しても一般化できるのか。
  • RQ5自己自己教師あり学習は、事前学習データにおける有害またはバイアスの強いコンテンツへの露出を低減する上でどのような意味を持つのか。

主な発見

  • ELECTRA-smallを用いた場合、10個の分類データセットのうち7つで、BookWikiでの標準的事前学習を上回った。RoBERTa-baseを用いた場合、5つで上回った。
  • 質問応答タスク(SQuAD)では、ELECTRA-smallが自己自己教師あり学習で78.47%のF1スコアを達成し、市販モデルの75.96%を上回った。
  • SWAG や HellaSwag などの構造化予測タスクでは、自己自己教師あり学習がランダム初期化に対して70–80%の性能向上を達成し、RoBERTa-baseでは40–80%の利益をもたらした。
  • 自己自己教師あり学習で学習したモデルは、市販モデルと比べて著しく相関の低い誤りを犯しており、異なるインダクティブバイアスを学習していることが示された。
  • ある下流データセットで事前学習したモデルは、他のデータセットに対してもよく一般化し、88%のケースで市販モデルの性能向上の50%以上を達成した。
  • 自己自己教師あり学習は、ウェブ規模の事前学習コーパスに含まれる有害コンテンツへの露出を回避しつつ、顕著な性能向上を実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。