Skip to main content
QUICK REVIEW

[論文レビュー] Improving Non-autoregressive Generation with Mixup Training

Ting Jiang, Shaohan Huang|arXiv (Cornell University)|Oct 21, 2021
Topic Modeling参考文献 33被引用数 8
ひとこと要約

本稿では、事前学習されたエンコーダーモデル(例:BERT、UniLM)を用いて非自己回帰的テキスト生成の性能を向上させるために、トレーニング中に入力元のシーケンスとモデルが生成する擬似ターゲットシーケンスを動的に混合する、MISTと呼ばれる新しいトレーニング手法を提案する。この手法により、推論速度に影響を与えることなく反復的改善が可能となり、要約、質問生成、並び替え生成のタスクで最先端の結果が得られた。

ABSTRACT

While pre-trained language models have achieved great success on various natural language understanding tasks, how to effectively leverage them into non-autoregressive generation tasks remains a challenge. To solve this problem, we present a non-autoregressive generation model based on pre-trained transformer models. To bridge the gap between autoregressive and non-autoregressive models, we propose a simple and effective iterative training method called MIx Source and pseudo Target (MIST). Unlike other iterative decoding methods, which sacrifice the inference speed to achieve better performance based on multiple decoding iterations, MIST works in the training stage and has no effect on inference time. Our experiments on three generation benchmarks including question generation, summarization and paraphrase generation, show that the proposed framework achieves the new state-of-the-art results for fully non-autoregressive models. We also demonstrate that our method can be used to a variety of pre-trained models. For instance, MIST based on the small pre-trained model also obtains comparable performance with seq2seq models.

研究の動機と目的

  • 事前学習エンコーダーモデルを非自己回帰的テキスト生成タスクに効果的に適応する課題に対処すること。
  • 推論速度を損なわずに自己回帰的モデルと非自己回帰的モデルの性能格差を解消すること。
  • 動的データ拡張を通じてモデルの収束性と一般化性能を向上させるトレーニング戦略を開発すること。
  • アーキテクチャの変更なしに、既存の事前学習モデル(例:BERT、UniLM)を非自己回帰的生成に活用できること。
  • 多様な生成タスクおよび事前学習モデルアーキテクチャにわたり一貫した性能向上を示すこと。

提案手法

  • 元のソースシーケンスとモデルが生成する擬似ターゲットシーケンスを入力として組み合わせるトレーニング時の反復的手法MISTを導入する。
  • トレーニング中、モデルはまず完全なターゲットシーケンスを生成し、その後その出力を2回目のフォワードパスの入力として扱う。
  • このプロセスにより、トレーニングの進行に応じて進化する、モデルに依存する動的でデータ拡張が可能になる。これにより、整合性が向上し、過学習が軽減される。
  • 変換器デコーダーにおける自己注意とクロス注意メカニズムを活用して、混合入力間の依存関係をモデル化する。
  • MISTはファインチューニング時に適用され、推論プロセスに影響を与えないため、非自己回帰的モデルの高速性を維持する。
  • このアプローチにより、条件付き依存関係のモデリングが可能となり、誤った予測に注目しやすいように誤りを起こしやすいトークンを強調できる。

実験結果

リサーチクエスチョン

  • RQ1MISTのような単純なトレーニング時手法が、自己回帰的モデルと非自己回帰的モデルの性能格差を効果的に埋めることが可能か?
  • RQ2ソースシーケンスと擬似ターゲットシーケンスの動的ミックスアップが、非自己回帰的生成における一般化性能と収束性を向上させるか?
  • RQ3MISTはアーキテクチャの変更なしに、さまざまな事前学習エンコーダーモデル(例:BERT、UniLM、MiniLM)に効果的に適用可能か?
  • RQ4MISTはMask-Predictのような反復的デコード手法と比較して、性能の安定性と収束速度の点で優れているか?
  • RQ5MISTは小規模な事前学習モデルを用いて、大規模な自己回帰的または事前学習されたシーケンス・トゥ・シーケンスモデルの性能に達成または上回ることが可能か?

主な発見

  • MISTは3つのNLGベンチマークで最先端の結果を達成した:SQuAD1.1(ROUGE-L 46.49)、XSum(ROUGE-L 28.70)、Quora(BLEU-4 29.77)。
  • SQuAD1.1では、ベースラインよりROUGE-Lで0.82ポイント向上、静的混合手法より0.75ポイント向上し、優れた動的データ拡張の有効性を示した。
  • XSumではベースラインより収束が早く、トレーニングステップを半分にしてもより良い性能を達成した。
  • Mask-Predictより反復的デコードにおいて優れた性能を示し、1、3、6回の反復において安定した向上が見られた。特にSQuAD1.1およびQuoraで顕著だった。
  • MiniLMにMISTを適用することで、大規模な自己回帰的モデルBANGと同等の性能を達成した。XSumではROUGE-Lが21.00、SQuAD1.1ではBLEU-4が12.98を記録した。
  • MISTにより、BERTやUniLMのような事前学習されたNLUモデルでも強力な性能が得られ、UniLMを用いたXSumではROUGE-Lが47.13に達し、一部の設定でBANGを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。