Skip to main content
QUICK REVIEW

[論文レビュー] Pre-training Text Representations as Meta Learning

Shangwen Lv, Yuechen Wang|arXiv (Cornell University)|Apr 12, 2020
Topic Modeling参考文献 29被引用数 7
ひとこと要約

本論文は、言語モデル化などの代理目的の代わりに、下流タスクのパフォーマンスを直接最適化することで、モデルに依存しないメタラーニング(MAML)として事前学習されたテキスト表現を提案する。事前学習中に一連のメタトレインステップを導入することで、より良い初期化を学習し、さまざまなNLPタスクでBERTを上回り、最初の微調整エポックからも収束が改善される。

ABSTRACT

Pre-training text representations has recently been shown to significantly improve the state-of-the-art in many natural language processing tasks. The central goal of pre-training is to learn text representations that are useful for subsequent tasks. However, existing approaches are optimized by minimizing a proxy objective, such as the negative log likelihood of language modeling. In this work, we introduce a learning algorithm which directly optimizes model's ability to learn text representations for effective learning of downstream tasks. We show that there is an intrinsic connection between multi-task pre-training and model-agnostic meta-learning with a sequence of meta-train steps. The standard multi-task learning objective adopted in BERT is a special case of our learning algorithm where the depth of meta-train is zero. We study the problem in two settings: unsupervised pre-training and supervised pre-training with different pre-training objects to verify the generality of our approach.Experimental results show that our algorithm brings improvements and learns better initializations for a variety of downstream tasks.

研究の動機と目的

  • 事前学習の代理目的(例:言語モデル化)と、下流タスクのための有用な表現を学ぶ真の目的との不一致を是正すること。
  • 事前学習をメタラーニングとして再解釈することで、下流の微調整のためのより良い初期化を得られるかを調査すること。
  • 多様な事前学習目的を用いた、教師ありおよび教師なしの設定において、提案されたメタラーニングベースの事前学習の有効性を評価すること。
  • 軽量モデル(例:ELMo)でさえも、初期化からより良い表現を学習できるかを示すこと。
  • 実証的に、メタラーニングで得た初期化が、微調整段階でより速くかつより良い収束を達成することを示すこと。

提案手法

  • モデルに依存しないメタラーニング(MAML)として事前学習を再定式化し、少数の勾配ステップで下流タスクに素早く適応できるように最適化する。
  • 事前学習中に一連のメタトレインステップを導入し、メタアップデートステップの前にタスク固有の勾配でモデルを更新する。
  • メタトレインステップ数がゼロの場合、標準的なマルチタスク学習目的(BERTのもの)が特別なケースとして現れる。
  • メタラーニングアルゴリズムを、教師なし事前学習(例:マスク言語モデル化)および教師あり事前学習(例:文対マッチング)の両方へ適用する。
  • 二段階のプロセスを採用:下流タスクの勾配でメタトレインステップを実行し、その後メタアップデートで初期化を改善する。
  • ランダム初期化からの学習を含め、BERTおよびELMoアーキテクチャの両方で手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1事前学習されたテキスト表現を、下流タスクのパフォーマンス向上に寄与するメタラーニングとして効果的に定式化できるか?
  • RQ2事前学習中のメタトレインステップ数が、学習された初期化の質にどのように影響するか?
  • RQ3提案されたメタラーニングベースの事前学習は、多様な下流タスクにおいて、標準的な代理目的の事前学習(例:BERT)を上回るか?
  • RQ4軽量モデル(例:ELMo)でさえも、初期化からより良い表現を学習できるか?
  • RQ5メタラーニングで得たモデルは、初期の微調整エポックでより良いパフォーランスを示すか、すなわち優れた初期化が得られているか?

主な発見

  • 提案されたメタラーニングベースの事前学習手法は、すべての評価された下流タスク(SST-2、MNLI、SNLI、CLOTH、QDC)でBERTを上回った。
  • QDCデータセットでは、k=10のメタトレインステップを用いたモデルが86.05%の正確度を達成し、収束時に85.44%を記録したBERTを上回った。
  • 最高のパフォーマンスは、常にk=5またはk=10のメタトレインステップで達成され、k=20ではパフォーマンスが低下したため、最適なメタトレーニングの深さがあることが示された。
  • 最初の微調整エポックにおいて、SST-2、SST-5、QDCでk≥1のモデルがBERTよりも高い正確度を示し、より優れた初期化であることを確認した。
  • ランダム初期化からELMoをメタラーニング手法で事前学習した場合、SNLIで88.3%の正確度を達成し、公式のELMo(88.0%)を上回った。
  • 公式のELMoを初期化として用い、さらにメタラーニングを適用することで、SNLIで88.5%の正確度に向上し、強い初期点に対しても本手法が性能を向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。