Skip to main content
QUICK REVIEW

[論文レビュー] Sequence-to-sequence Pre-training with Data Augmentation for Sentence Rewriting

Yi Zhang, Tao Ge|arXiv (Cornell University)|Sep 13, 2019
Natural Language Processing Techniques参考文献 51被引用数 19
ひとこと要約

本論文は、データ拡張を活用した文書き直しタスクのための2段階のseq2seq事前学習および微調整フレームワークを提案する。拡張データでの事前学習とゴールドデータでの微調整を分離することで、ノイズの影響を回避する。3つの新しいデータ拡張手法—バックトランスレーション、特徴の区別、マルチタスク転送—を導入し、CoNLL-2014、JFLEG、GYAFCベンチマークで最先端の結果を達成。GYAFCではBLEUスコアが2.23および2.64ポイント向上し、自由設定下ではF0.5スコアが66.77を超える。

ABSTRACT

We study sequence-to-sequence (seq2seq) pre-training with data augmentation for sentence rewriting. Instead of training a seq2seq model with gold training data and augmented data simultaneously, we separate them to train in different phases: pre-training with the augmented data and fine-tuning with the gold data. We also introduce multiple data augmentation methods to help model pre-training for sentence rewriting. We evaluate our approach in two typical well-defined sentence rewriting tasks: Grammatical Error Correction (GEC) and Formality Style Transfer (FST). Experiments demonstrate our approach can better utilize augmented data without hurting the model's trust in gold data and further improve the model's performance with our proposed data augmentation methods. Our approach substantially advances the state-of-the-art results in well-recognized sentence rewriting benchmarks over both GEC and FST. Specifically, it pushes the CoNLL-2014 benchmark's $F_{0.5}$ score and JFLEG Test GLEU score to 62.61 and 63.54 in the restricted training setting, 66.77 and 65.22 respectively in the unrestricted setting, and advances GYAFC benchmark's BLEU to 74.24 (2.23 absolute improvement) in E&M domain and 77.97 (2.64 absolute improvement) in F&R domain.

研究の動機と目的

  • 文書き直しタスクにおける同時学習時、ノイズが多く誤った編集を含む拡張データがモデルを誤導する問題に対処すること。
  • ゴールドデータでの微調整の前に多様な拡張データで事前学習することで、モデルの一般化性能と性能を向上させること。
  • バックトランスレーション、特徴の区別、マルチタスク転送を含む、文書き直しタスクに特化した複数のデータ拡張手法の開発と評価。
  • 拡張データとゴールドデータを同時に使用した学習と比較して、拡張データでの事前学習が優れていることを実証的に検証すること。
  • 文法的誤り補正(GEC)およびフォーマルリズムスタイル転送(FST)のための標準ベンチマークで最先端の性能を達成すること。

提案手法

  • モデルは、データ拡張技術によって生成された合成的で拡張された文対を用いて事前学習した後、ゴールドスタンダードの訓練データで微調整される。
  • 3つのデータ拡張手法を導入:パラフレーズ文対の生成のためのバックトランスレーション、高品質なフォーマルリズム強化対のフィルタリングのための特徴の区別、GECデータを活用したフォーマルリズム転送の向上のためのマルチタスク転送。
  • 事前学習フェーズでは、ノイズの多い編集によって汚染されないよう、拡張データを活用して文脈的表現と変換パターンを学習する。
  • 微調整はゴールドデータに限定して実施され、正しい編集に対するモデルの信頼性を保ち、ターゲット分布との整合性を確保する。
  • データ使用を明確に段階に分け、拡張データ内の誤った編集をモデルが学習するのを防ぐ。
  • 本アプローチは、文法的誤り補正(GEC)とフォーマルリズムスタイル転送(FST)という2つの主要な文書き直しタスクで評価される。

実験結果

リサーチクエスチョン

  • RQ1拡張データでの事前学習に続いてゴールドデータでの微調整を行うアプローチが、両方のデータを同時に使用した学習を上回るのか?
  • RQ2バックトランスレーション、特徴の区別、マルチタスク転送といった複数のデータ拡張戦略が、文書き直しタスクにおけるモデルの一般化性能と性能を向上させられるか?
  • RQ3文書き直しタスクにおいて、拡張データのみで学習したモデルとゴールドデータのみで学習したモデルの性能はどのように異なるか?
  • RQ4本手法はCoNLL-2014、JFLEG、GYAFCといった標準ベンチマークで、最先端の結果をどの程度向上させるか?
  • RQ5なぜ拡張データを同時に使用した学習では性能が低下するのか?また、2段階アプローチはその問題をどのように緩和するか?

主な発見

  • 提案された事前学習と微調整アプローチは、自由設定下のCoNLL-2014ベンチマークでF0.5スコア66.77という新たな最先端のスコアを達成し、従来手法を上回った。
  • JFLEGベンチマークでは、自由設定下でGLEUスコア65.22を達成し、先行研究に比べて顕著な向上を示した。
  • GYAFCベンチマークでは、E&MドメインでBLEUスコアが2.23ポイント向上(74.24に達成)、F&Rドメインで2.64ポイント向上(77.97に達成)した。
  • 拡張データのみで学習したモデルは、WMT14英語-ドイツ語翻訳でBLEUスコア28.8を達成し、ゴールドデータと同等の性能を示したが、文書き直しタスクではノイズの多い編集のため性能が著しく劣化した。
  • 2段階学習戦略により、拡張データ内の誤った編集を学習するのを防ぎ、同時に学習よりも優れた性能を達成した。
  • 特徴の区別とマルチタスク転送の統合により、特にフォーマルリズムスタイル転送において、拡張データの質と関連性が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。