Skip to main content
QUICK REVIEW

[論文レビュー] Data-Efficient Pretraining via Contrastive Self-Supervision

Nils Rethmeier, Isabelle Augenstein|arXiv (Cornell University)|Oct 2, 2020
Topic Modeling参考文献 41被引用数 8
ひとこと要約

本論文は、NLP事前学習のためのデータおよび計算効率の良い対照的自己教師学習手法であるCLESSを提案する。この手法は、タスク内テキストのみ60MBを用い、外部データ160GBで事前学習されたRoBERTaを、ゼロショット、フェイントショット、ロングテイル一般化タスクのすべてで上回り、学習時間も5分の1で済む。この方法により、大規模な事前学習データやモデルサイズに依存せずに、効果的な自己教師学習が可能となり、自己教師学習の強化が、より低リソースかつ公平な表現学習のためのデータおよびパrameterスケーリングの代替手段となり得ることを示している。

ABSTRACT

For natural language processing `text-to-text' tasks, the prevailing approaches heavily rely on pretraining large self-supervised models on increasingly larger `task-external' data. Transfer learning from high-resource pretraining works well, but research has focused on settings with very large data and compute requirements, while the potential of efficient low-resource learning, without large `task-external' pretraining, remains under-explored. In this work, we evaluate against three core challenges for resource efficient learning. Namely, we analyze: (1) pretraining data ($X$) efficiency; (2) zero to few-shot label ($Y$) efficiency; and (3) long-tail generalization, since long-tail preservation has been linked to algorithmic fairness and because data in the tail is limited by definition. To address these challenges, we propose a data and compute efficient self-supervised, contrastive text encoder, pretrained on 60MB of `task-internal' text data, and compare it to RoBERTa, which was pretrained on 160GB of `task-external' text. We find our method outperforms RoBERTa, while pretraining and fine-tuning in a 1/5th of RoBERTa's fine-tuning time.

研究の動機と目的

  • 自己教師学習の事前学習が、最小限のデータと計算リソースで有効に機能するかを調査し、大規模な「タスク外部」事前学習に依存する現在の傾向に挑戦すること。
  • 低リソース環境下でのデータ効率(X効率性)、ラベル効率(Y効率性)、ロングテイル一般化性能を評価すること。
  • アルゴリズム的公平性を向上させ、大規模事前学習でしばしば無視されるレアクラスの情報を保持すること。
  • 対照的自己教師学習が、より効率的かつ公平な表現学習を達成するため、大規模事前学習データやモデルサイズの代替手段として機能できることを示すこと。
  • 教師付き事前学習に依存せず、直接下流タスクに転送可能な自己教師学習型ゼロショット対応モデルの開発

提案手法

  • タスク内テキストのみ60MBで学習する対照的自己教師学習目的(Contrastive Learning-Data Efficient Self-Supervision、CLESS)を提案し、外部事前学習データを一切使用しない。
  • 埋め込み空間におけるノイズ対比推定に基づく対照的目的を採用し、無限のクラス集合を可能にするとともに、ソフトマックスベースの目的と比較して計算コストを低減する。
  • 同じタスクデータから生成された自己教師学習的擬似ラベルを用いて、小規模モデル(最大10Mパラメータ)を事前学習し、外部データなしで信号の多様性を向上させる。
  • 下流タスクに直接自己教師学習の表現ヘッドを転送することでゼロショット予測を可能にし、微調整によって生じるバイアスを回避する。
  • ヘッドからテールまでの5つのバケットにクラス頻度をバランスさせ、ロングテイル一般化を公平に評価する。テールバケットには1,315クラスのうち80.7%が含まれる。
  • ゼロショット、フェイントショット、ロングテイル一般化ベンチマークにおいて、RoBERTa(125Mパラメータ、160GB事前学習データ)と比較する。

実験結果

リサーチクエスチョン

  • RQ1タスク内テキストのみ60MBで学習した自己教師学習モデルが、外部データ160GBで事前学習されたモデルを上回る性能を発揮できるか?
  • RQ2対照的自己教師学習が、限られたラベル付きデータ下で、標準的なマスキング言語モデル学習よりも優れたゼロショットおよびフェイントショット一般化性能を達成できるか?
  • RQ3小さな対照的事前学習モデルが、RoBERTaのような大規模で外部事前学習されたモデルよりも、ロングテイルクラスに対してより優れた一般化性能を示せるか?
  • RQ4自己教師学習の信号量とモデルサイズを増加させることで、最小限の事前学習データでもロングテイル一般化性能が向上するか?
  • RQ5対照的自己教師学習が、大規模事前学習データやモデルサイズの必要性を補い、より効率的かつ公平な表現学習を実現できるか?

主な発見

  • CLESSはゼロショット学習でRoBERTaを上回り、モデルサイズを25%増加させた場合に49%の性能向上を達成した。
  • フェイントショット学習では、60MBのタスク内データで事前学習したCLESSが、160GBの外部データで微調整したRoBERTaを上回り、ラベル付きインスタンスの10%のみで実行した。
  • 最大のCLESSモデル(10Mパラメータ)は、ロングテイルクラスバケットで平均マイクロ-F1が.251を達成したのに対し、RoBERTaは.173であった。99.5%のクラスでCLESSが優位であった。
  • CLESSは、3桁少ない事前学習データ量と少ないパラメータ数にもかかわらず、ロングテイル情報の保持が顕著に優れており、大規模データが常にレアクラス学習を改善するという仮定に反する。
  • 自己教師学習的擬似ラベルの数とモデルサイズを増加させることでロングテイル一般化性能が向上し、自己教師学習における信号量とモデルスケールが、データスケールの欠如を補うことが示された。
  • CLESSの事前学習と微調整に要する時間は15+10時間で、RoBERTaの微調整時間126時間と比較して5倍短縮され、学習コストの5倍削減を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。