Skip to main content
QUICK REVIEW

[論文レビュー] PALM: Pre-training an Autoencoding&Autoregressive Language Model for Context-conditioned Generation

Bin Bi, Chenliang Li|arXiv (Cornell University)|Apr 14, 2020
Topic Modeling参考文献 44被引用数 20
ひとこと要約

PALMは、1つのTransformerエンコーダーデコーダー構造内ですべてのオートエンコーディングと自己回帰的目標を同時に最適化する、画期的な事前学習フレームワークを提案している。これにより、強力な文脈条件付きテキスト生成が可能となり、要約、質的質問応答、対話生成など、複数の生成ベンチマークで最先端の結果を達成した。特に、CNN/DailyMailではROUGE-Lスコア39.71、MARCOでは0.498を記録し、従来手法を大きく上回った。

ABSTRACT

Self-supervised pre-training, such as BERT, MASS and BART, has emerged as a powerful technique for natural language understanding and generation. Existing pre-training techniques employ autoencoding and/or autoregressive objectives to train Transformer-based models by recovering original word tokens from corrupted text with some masked tokens. The training goals of existing techniques are often inconsistent with the goals of many language generation tasks, such as generative question answering and conversational response generation, for producing new text given context. This work presents PALM with a novel scheme that jointly pre-trains an autoencoding and autoregressive language model on a large unlabeled corpus, specifically designed for generating new text conditioned on context. The new scheme alleviates the mismatch introduced by the existing denoising scheme between pre-training and fine-tuning where generation is more than reconstructing original text. An extensive set of experiments show that PALM achieves new state-of-the-art results on a variety of language generation benchmarks covering generative question answering (Rank 1 on the official MARCO leaderboard), abstractive summarization on CNN/DailyMail as well as Gigaword, question generation on SQuAD, and conversational response generation on Cornell Movie Dialogues.

研究の動機と目的

  • 変な文脈条件付き生成タスク(例:要約や生成的質問応答)と、事前学習の目的(例:ノイズ除去)との間にある不一致を是正すること。
  • オートエンコーディングと自己回帰的モデリングの長所を統合した統一的な事前学習スキームを設計し、より良い文脈理解とテキスト生成を実現すること。
  • 入力文脈の深い理解を要する生成タスク(例:自己完結的で要約的である回答や応答を生成すること)のパフォーマンスを向上させること。
  • 事前学習と微調整の間の分布の不一致を縮小し、事前学習の目的を実際の生成行動に近づけること。

提案手法

  • 大規模なラベルなしコーパス上で、統合的な事前学習を実行する標準的なTransformerエンコーダーデコーダー構造を採用している。
  • まず、エンコーダーとデコーダーを用いて、入力シーケンス内のマスクされたスパンを再構築することでオートエンコーディングを実行する。
  • 次に、デコーダーが左から右へ順に次のトークンを予測する自己回帰的生成フェーズに移行する。
  • 2段階の目的関数を用いてモデルを事前学習する:最初にノイズ除去(オートエンコーディング)、次に自己回帰的生成。両者とも同じ文脈に基づく。
  • 適切な場合に入力からコンテンツをコピーすることで生成品質を向上させるために、ポインタジェネレーターネットワークをデコーダーに統合している。
  • 事前学習の目的は、文脈からの新規コンテンツの理解と生成が不可欠なタスク(例:要約的要約や生成的QA)に、より適切に一致するように設計されている。

実験結果

リサーチクエスチョン

  • RQ1オートエンコーディングと自己回帰的目標を統合した統一的な事前学習フレームワークは、文脈条件付きテキスト生成を改善できるか?
  • RQ2オートエンコーディングと自己回帰の共同事前学習は、要約的要約や生成的質問応答のパフォーマンスにどのように影響するか?
  • RQ3ポインタジェネレーターネットワークの統合は、文脈に依存するタスクにおける生成品質をどの程度向上させるか?
  • RQ4オートエンコーディング、自己回帰、事前学習といった個々のコンponentsは、PALM全体のパフォーマンスにどの程度寄与しているか?
  • RQ5PALMの事前学習スキームは、生成タスクにおける事前学習と微調整の間の分布の不一致を軽減するか?

主な発見

  • PALMは、要約的要約ベンチマークであるCNN/DailyMailで、ROUGE-Lスコア39.71という新記録を更新し、従来手法を大きく上回った。
  • MARCO自然言語生成リーダーボードでは、ROUGE-Lスコア0.498を達成し、全モデルの中で1位を獲得した。
  • ポインタジェネレーターコンponentは性能向上に寄与しており、削除するとROUGE-Lスコアが0.22低下した。これは、滑らかさと内容の正確性の向上に寄与していることを示している。
  • アブレーションスタディの結果、オートエンコーディングと自己回帰の両方が不可欠であることが判明。事前学習を削除するとパフォーマンスが6.5%以上低下した。
  • モデルは優れた一般化性能を示し、会話応答生成、質問生成、Gigawordにおける要約的要約など、多様なタスクで最先端の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。