[論文レビュー] Train No Evil: Selective Masking for Task-Guided Pre-Training
本稿では、一般的事前学習と微調整の間に、選択的マスキングを施したタスク指向的事前学習段階を組み込んだ三段階訓練フレームワークを提案する。ドメイン固有のデータにおいて、学習された重要度スコアを用いてタスクに重要なトークンを特定・マスキングすることで、標準的な事前学習と比較して計算コストの50%未満で感情分析タスクの性能を向上させる。
Recently, pre-trained language models mostly follow the pre-train-then-fine-tuning paradigm and have achieved great performance on various downstream tasks. However, since the pre-training stage is typically task-agnostic and the fine-tuning stage usually suffers from insufficient supervised data, the models cannot always well capture the domain-specific and task-specific patterns. In this paper, we propose a three-stage framework by adding a task-guided pre-training stage with selective masking between general pre-training and fine-tuning. In this stage, the model is trained by masked language modeling on in-domain unsupervised data to learn domain-specific patterns and we propose a novel selective masking strategy to learn task-specific patterns. Specifically, we design a method to measure the importance of each token in sequences and selectively mask the important tokens. Experimental results on two sentiment analysis tasks show that our method can achieve comparable or even better performance with less than 50% of computation cost, which indicates our method is both effective and efficient. The source code of this paper can be obtained from https://github.com/thunlp/SelectiveMasking.
研究の動機と目的
- 事前学習モデルにおけるタスクに依存しない事前学習と、データが限られた微調整の限界を解消すること。
- 事前学習段階でドメイン固有およびタスク固有のパターンを捉えることで、下流タスクにおけるモデル性能を向上させること。
- ランダムマスキングではなく、意味的に重要なトークンに焦点を当てることで、計算コストを削減すること。
- 下流タスクのデータを活用してドメイン内事前学習をガイドする選択的マスキング戦略を開発することであり、ドメイン内データに対する完全な教師付き情報は不要である。
提案手法
- 一般的事前学習、選択的マスキングを施したタスク指向的事前学習、微調整の三段階訓練フレームワークを導入する。
- ドメイン固有の教師なしデータ(例:Yelpレビューデータ)を用いてタスク指向的事前学習を行い、ドメイン固有のパターンを学習する。
- 下流タスクの教師ありデータを用いて各トークンのタスク固有の重要度スコアを定義し、重要トークンを特定する。
- 下流タスクのデータ上でニューラルネットワークを学習させ、暗黙のトークン選択ルールを学習し、ドメイン内データ上で重要なトークンの教師なし選択を可能にする。
- マスク言語モデルの実行時に、選択的マスキングを適用:重要度スコアが低いトークンのみをマスキングし、重要トークンからの学習に焦点を当てる。
- 学習された重要度モデルを用いて、中規模のドメイン内データにおけるマスキングをガイドし、事前学習段階で完全な教師付き情報に依存しないようにする。
実験結果
リサーチクエスチョン
- RQ1選択的マスキングを施したタスク指向的事前学習は、標準的な事前学習→微調整と比較して、下流タスクの性能を向上させることができるか?
- RQ2重要トークンの選択的マスキングは、ランダムマスキングと比較して、モデルの効率性と有効性を向上させるか?
- RQ3ドメイン内データと下流タスクデータとの類似性が、タスク指向的事前学習の性能に与える影響は何か?
- RQ4限られた教師ありデータで学習したモデルは、教師なしドメイン内データに対しても一般化可能な重要トークンを同定できるか?
主な発見
- 提案手法は、計算コストを50%未満に抑える一方で、標準的な事前学習と同等またはそれ以上の性能を達成する。
- SemEval14-Rest + Yelpの設定では、全事前学習BERT_BASEと比較して1.4%の性能向上を達成し、訓練ステップ数は半分で実現した。
- ドメインデータが下流タスクと類似していない状況を含め、あらゆる設定で選択的マスキングがランダムマスキングを常に上回る性能を示した。
- MR+Yelp設定(ドメイン不一致が高い状況)においても、選択的マスキングはランダムマスキングに対して0.95%の向上を示し、ドメインシフトに対して高いロバスト性を示した。
- 事例研究により、本手法が教師ありおよび教師なしデータの両方で感情に重要なトークン(例:'funny', 'awsum', 'like')を正しく同定できていることが確認された。
- 選択的マスキングを施したタスク指向的事前学習は、全事前学習にタスクガイドなしの条件と比較して、4つの設定のうち3つで統計的に有意な改善(p < .05 または p < .001)を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。