[論文レビュー] MVP: Multi-task Supervised Pre-training for Natural Language Generation
本稿では、自然言語生成(NLG)のためのMVP(Multi-task Supervised Pre-training)を提案する。MVPは、11のNLGタスクにまたがる77のデータセットを統合した大規模なテキスト対テキストコーパス上で、シーケンス・ツー・シーケンスモデルを事前学習する手法である。タスク固有のソフトプロンプトを用いた教師あり事前学習により、MVPは17のベンチマークデータセットのうち13つでSOTA性能を達成し、BARTより9.3%、Flan-T5より5.8%優れている。
Pre-trained language models (PLMs) have achieved remarkable success in natural language generation (NLG) tasks. Up to now, most NLG-oriented PLMs are pre-trained in an unsupervised manner using the large-scale general corpus. In the meanwhile, an increasing number of models pre-trained with labeled data (i.e. "supervised pre-training") showcase superior performance compared to unsupervised pre-trained models. Motivated by the success of supervised pre-training, we propose Multi-task superVised Pre-training (MVP) for natural language generation. We collect a large-scale natural language generation corpus, MVPCorpus, from $77$ datasets over $11$ diverse NLG tasks. Then we unify these examples into a general text-to-text format to pre-train the text generation model MVP in a supervised manner. For each task, we further pre-train specific soft prompts to stimulate the model's capacity to perform a specific task. Our MVP model can be seen as a practice that utilizes recent instruction tuning on relatively small PLMs. Extensive experiments have demonstrated the effectiveness and generality of our MVP model in a number of NLG tasks, which achieves state-of-the-art performance on $13$ out of $17$ datasets, outperforming BART by $9.3\%$ and Flan-T5 by $5.8\%$.
研究の動機と目的
- 教師あり事前学習の限界を克服し、ノイズの導入や知識習得の遅れを防ぐため。
- 訓練の初期段階でラベル付きデータを用いた教師あり事前学習が、事前学習モデルを下流のNLGタスクにうまく整合させられるかを検証するため。
- マルチタスク学習を通じて、多様なテキスト生成タスクに効果的に一般化できる汎用的NLGモデルを構築するため。
- タスク固有のソフトプロンプトが、特定のNLGタスクに特化したモデル容量を向上させる有効性を調査するため。
- 今後の教師あり事前学習研究を支援するため、最大の既知のラベル付きNLGデータセットコレクションであるMVPCorpusを構築・公開するため。
提案手法
- 11の多様なNLGタスクにまたがる77のデータセットを収集・統合し、タスク固有の指示を含む標準化されたテキスト対テキスト形式に変換することでMVPCorpusを構築する。
- Transformerベースのシーケンス・ツー・シーケンスモデルをMVPCorpus上で教師あり学習により事前学習することで、タスク固有のパターンを事前学習段階で直接学習可能にする。
- プレフィックスチューニング方式のメカニズムを用いてタスク固有のソフトプロンプトを導入し、完全なファインチューニングを伴わずにモデルが異なるタスクに動的に適応できるようにする。
- 11のNLGタスクを同時に最適化するマルチタスク学習を採用することで、一般化性能を向上させるとともに、タスク間の干渉を低減する。
- パラメータ効率の良いチューニング(例:プレフィックスチューニング)を適用し、下流タスクにおけるゼロショットおよびフェイントショット性能を評価する。
- 自然言語による指示を用いて入出力フォーマットを標準化することで、事前学習における互換性と一貫性を確保する。
実験結果
リサーチクエスチョン
- RQ1大規模かつマルチタスクなNLGコーパス上で教師あり事前学習を実施することで、教師なし事前学習に比べてモデル性能が向上するか?
- RQ2多様なNLGタスクを用いたマルチタスク学習が、事前学習モデルの一般化能力を向上させるか?
- RQ3タスク固有のソフトプロンプトが、個々のNLGタスクに特化した知識を効果的に捉え蓄積できるか?
- RQ4MVPは、Flan-T5 や BART といったSOTAモデルと比較して、フルチューニングおよびパラメータ効率の良いファインチューニングの両設定で優れているか?
- RQ5教師あり事前学習は、NLGにおける事前学習とファインチューニングのドメインギャップをどの程度低減するか?
主な発見
- MVPは17のベンチマークデータセットのうち13つでSOTA性能を達成し、多様なNLGタスクにわたる強力な一般化能力を示している。
- フルチューニング設定では、17のデータセット全体で平均性能がBARTを9.3%上回っている。
- パラメータ効率の良いチューニング(例:プレフィックスチューニング)でも、MVPはBARTを4.3%上回っており、低ショット適応性の高さが裏付けられている。
- 平均性能においてFlan-T5を5.8%上回っており、強力なインstructチューニングベースラインを凌駆する優位性が確認された。
- MVPのゼロショット性能はT0-11Bを大きく上回っており、教師あり事前学習の有効性が顕著に示された。
- タスク固有のソフトプロンプトの統合(MVP+S)により、特定のタスクでさらに性能が向上し、プロンプトベースの適応の価値が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。