Skip to main content
QUICK REVIEW

[論文レビュー] An Embarrassingly Simple Approach for Transfer Learning from Pretrained Language Models

Alexandra Chronopoulou, Christos Baziotis|arXiv (Cornell University)|Feb 27, 2019
Topic Modeling参考文献 33被引用数 19
ひとこと要約

本稿では、タスク固有の損失と徐々に減少する補助言語モデル損失を組み合わせることで、事前学習済み言語モデルの微調整を行うシンプルで効果的な転移学習手法SiATLを提案する。この手法は、深刻な忘却を防ぎ、複数の感情分析およびテキスト分類タスクで最先端の性能を達成し、限られた学習データでもULMFiTのような複雑な手法を上回る。

ABSTRACT

A growing number of state-of-the-art transfer learning methods employ language models pretrained on large generic corpora. In this paper we present a conceptually simple and effective transfer learning approach that addresses the problem of catastrophic forgetting. Specifically, we combine the task-specific optimization function with an auxiliary language model objective, which is adjusted during the training process. This preserves language regularities captured by language models, while enabling sufficient adaptation for solving the target task. Our method does not require pretraining or finetuning separate components of the network and we train our models end-to-end in a single step. We present results on a variety of challenging affective and text classification tasks, surpassing well established transfer learning methods with greater level of complexity.

研究の動機と目的

  • 事前学習済み言語モデルの微調整中に発生する深刻な忘却を緩和すること。
  • 複雑なスケジューリングやマルチステージ学習を避ける、計算効率的で概念的に単純な手法を開発すること。
  • タスク固有の分布に適応しながら一般言語規則を保持することで、リソースが限られたテキスト分類タスクの性能を向上させること。
  • 重み付き補助損失を用いたエンドツーエンド学習が、より複雑な転移学習パイプラインを上回ることを示すこと。

提案手法

  • 事前学習済み言語モデル(ツイッターコーパスで学習済み)の重みを、タスク固有の再帰層と分類ヘッドを備えた分類器に転送する。
  • タスク固有の分類損失と補助言語モデル損失の重み付き和であるマルチタスク目的関数を用いて、モデル全体をエンドツーエンドで学習する。
  • 訓練エポックにわたって、言語モデル損失の重み係数γを初期値(例:0.2)から最終値(例:0.1)へ徐々に減少させ、その影響を時間とともに弱める。
  • 上位層から順次凍結解除を行うことで、学習済み表現を上書きせずにドメイン適応を可能にする。
  • 別々の事前学習、微調整、転送ステージを必要としない、ワンステップのエンドツーエンド学習プロセスを採用する。
  • ハイパーパrameter γ を時間とともに減少させることで、言語モデルの知識保持とターゲットタスクへの適応のトレードオフを制御する。

実験結果

リサーチクエスチョン

  • RQ1補助言語モデル損失を用いたシンプルなワンステップ学習手順は、事前学習済み言語モデルからの転移学習において、深刻な忘却を効果的に防止できるか?
  • RQ2特にリソースが限られた条件下で、ULMFiTのようなより複雑な転移学習パイプラインと比較して、本手法の性能はどの程度か?
  • RQ3減少する補助損失を用いることで、多様なテキスト分類タスクにおける汎化性能とモデルの頑健性が向上するか?
  • RQ4事前学習データとターゲットデータのドメインに差がある場合、順次凍結解除はどの程度性能向上に寄与するか?
  • RQ5タスク固有のアーキテクチャ変更や複雑な最適化率スケジューリングを必要とせずに、競争力のある結果を達成できるか?

主な発見

  • SiATLは、1,000件未満の学習例を有する小さなデータセットを含め、評価されたすべてのテキスト分類タスクでULMFiTを上回る性能を示した。
  • SCv2データセットでは、Ilicら(2018)の最先端モデルに非常に近い性能を達成し、リソースが限られた状況での強力な汎化性能を示した。
  • 補助言語モデル損失は性能向上に顕著な寄与を示した:P-LM + auxモデルはすべての下流タスクでP-LMモデルを上回り、深刻な忘却の緩和に寄与していることが確認された。
  • SCv1データセットでは7%の性能向上を達成し、ターゲット語彙が限られている状況でも、補助損失がより良い適応を可能にしていることが示された。
  • 順次凍結解除は、非ツイッター・ドメインタスク(例:PsychExp, SCv2)で顕著な向上をもたらした。これはドメイン適応において重要な役割を果たしていることを示している。
  • γの減少スケジュールに対して本手法は頑健であった:指数関数的減少と線形減少の性能は類似しており、ハイパーパrameterチューニングへの感受性が低いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。