Skip to main content
QUICK REVIEW

[論文レビュー] reStructured Pre-training

Weizhe Yuan, Pengfei Liu|arXiv (Cornell University)|Jun 22, 2022
Topic Modeling被引用数 5
ひとこと要約

本論文は、モデルの事前学習とファインチューニングを構造化された情報の保存と取得プロセスとして扱う、再構造化された事前学習(RST)と呼ばれる新しいNLPパラダイムを紹介する。この手法は、生テキストよりも構造化された情報を重視する。26種類の信号(例:名前付きエンティティ、品詞、構文的依存関係など)を含む再構成済みデータを10の異なるソースから収集し、事前学習することで得られたモデル、Qinは、55のNLPベンチマークのうち52で最先端のゼロショット性能を達成し、2018年の高評価英語試験では150点中138.5点を記録。これは平均的人間の得点より40点高く、パラメータが1/16のGPT-3よりも15点高い。

ABSTRACT

In this work, we try to decipher the internal connection of NLP technology development in the past decades, searching for essence, which rewards us with a (potential) new learning paradigm for NLP tasks, dubbed as reStructured Pre-training (RST). In such a paradigm, the role of data will be re-emphasized, and model pre-training and fine-tuning of downstream tasks are viewed as a process of data storing and accessing. Based on that, we operationalize the simple principle that a good storage mechanism should not only have the ability to cache a large amount of data but also consider the ease of access. We achieve this by pre-training models over restructured data that consist of a variety of valuable information instead of raw data after overcoming several engineering challenges. Experimentally, RST models not only surpass strong competitors (e.g., T0) on 52/55 popular datasets from a variety of NLP tasks, but also achieve superior performance in National College Entrance Examination - English (Gaokao-English),the most authoritative examination in China. Specifically, the proposed system Qin achieves 40 points higher than the average scores made by students and 15 points higher than GPT3 with 1/16 parameters. In particular, Qin gets a high score of 138.5 (the full mark is 150) in the 2018 English exam (national paper III). We have released the Gaokao Benchmark with an online submission platform. In addition, we test our model in the 2022 College Entrance Examination English that happened a few days ago (2022.06.08), and it gets a total score of 134 (v.s. GPT3's 108).

研究の動機と目的

  • NLP技術開発における根本的な進化パターンを特定し、その進行を統一的仮説で説明すること。
  • 現在の事前学習パラダイムの限界を克服するため、生データから構造的・情報豊富なデータ表現へ焦点を移すこと。
  • モデルの事前学習をデータの保存とアクセスメカニズムとして扱う、再構造化された事前学習(RST)という新しい学習パラダイムを構築すること。
  • タスク固有のファインチューニングなしで、国立大学入学共通試験(高評価英語)で人間水準の性能を達成できるAIシステム、Qinを構築すること。
  • 実世界の高利害な教育試験(高評価英語など)におけるAI性能を評価するための公開ベンチマークと評価プラットフォームを確立すること。

提案手法

  • RSTは、事前学習を構造化された情報の保存と効率的な取得プロセスとして再定義し、データを再構成することで26種類の異なる信号タイプ(例:名前付きエンティティ、品詞、構文的依存関係)を抽出・整理する。
  • Wikipedia、CLOTH、BEA 2019、高評価英語試験など10の多様なソースからのデータを集約し、統一的かつ情報豊富な学習コーパスを構築する。
  • 各データタイプに対して、特化したデータ構築技術を適用する:読解問題にはクローズド形式のマスキング(ヒントあり・なしを含む)、ライティングタスクには文法誤りに配慮したデータを用いる。
  • 統一された目的関数を用いて、この再構成済みデータ上でモデルを事前学習させ、情報のアクセス性と取得効率を最適化する。
  • 得られた汎用モデル、Qinは、ファインチューニングなしで55のNLPタスクにおいてゼロショット設定で評価され、実世界の高評価英語試験でも検証される。
  • ExplainaBoardを用いて、インタラクティブなランクイングと高評価ベンチマークを公開し、AIの進歩を公開評価および長期的追跡可能にする。

実験結果

リサーチクエスチョン

  • RQ1NLP技術開発における根本的な進化パターンは何か。そして、これにより将来のイノベーションをどのように導けるか。
  • RQ2再構成済み・情報豊富なデータ上で事前学習することで、生テキスト上での従来の事前学習に比べてゼロショット一般化性能が向上するか。
  • RQ31つの統一モデルが、ファインチューニングなしで、高利害で現実世界の試験(高評価英語)で人間水準の性能を達成できるか、その範囲はどの程度か。
  • RQ4複数のソースから得られる多様で不均一な信号を、1つの事前学習フレームワーク内で統合し、効果的に活用できるか。
  • RQ5データ中心の事前学習アプローチが、教育分野におけるより公平でスケーラブルなAIアプリケーションの実現に寄与できるか。

主な発見

  • RSTモデルは、分類、情報抽出、事実検索、テキスト生成をカバーする55の標準NLPベンチマークのうち52で最先端のゼロショット性能を達成した。
  • 2018年の高評価英語試験(全国Ⅲ類)では、Qinモデルが150点中138.5点を記録。これは平均的人間得点より40点高く、パラメータが1/16のGPT-3よりも15点高い。
  • 2022年の大学入学共通試験(2022年6月8日)では、モデルが高評価英語試験で合計134点を達成。GPT-3の108点を上回った。
  • 2018年の高評価英語試験の聴解および読解理解セクションで、両方とも満点を獲得。高難易度で現実世界のタスクにおいて優れた性能を示した。
  • 2018年から2021年までの10部の英語試験ペーパーをアノテート済みで含む高評価ベンチマークが公開され、オンライン提出プラットフォームを備えており、公開評価とAI進歩の長期的追跡が可能になった。
  • RSTの成功は、構造的・情報豊富なデータ上で事前学習することで、生データ上の事前学習よりも効果的であることを示し、データ中心のAI開発への移行を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。