Skip to main content
QUICK REVIEW

[论文解读] Sequence-to-sequence Pre-training with Data Augmentation for Sentence Rewriting

Yi Zhang, Tao Ge|arXiv (Cornell University)|Sep 13, 2019
Natural Language Processing Techniques参考文献 51被引用 19
一句话总结

本文提出了一种两阶段序列到序列预训练与微调框架,利用数据增强技术进行句子重写任务,将增强数据上的预训练与真实数据上的微调分离,以避免噪声干扰。该方法引入了三种新颖的数据增强方法——回译、特征判别和多任务迁移,在CoNLL-2014、JFLEG和GYAFC基准上取得最先进结果,GyaFC上的BLEU分数分别提升2.23和2.64点,无限制设置下的F0.5分数超过66.77。

ABSTRACT

We study sequence-to-sequence (seq2seq) pre-training with data augmentation for sentence rewriting. Instead of training a seq2seq model with gold training data and augmented data simultaneously, we separate them to train in different phases: pre-training with the augmented data and fine-tuning with the gold data. We also introduce multiple data augmentation methods to help model pre-training for sentence rewriting. We evaluate our approach in two typical well-defined sentence rewriting tasks: Grammatical Error Correction (GEC) and Formality Style Transfer (FST). Experiments demonstrate our approach can better utilize augmented data without hurting the model's trust in gold data and further improve the model's performance with our proposed data augmentation methods. Our approach substantially advances the state-of-the-art results in well-recognized sentence rewriting benchmarks over both GEC and FST. Specifically, it pushes the CoNLL-2014 benchmark's $F_{0.5}$ score and JFLEG Test GLEU score to 62.61 and 63.54 in the restricted training setting, 66.77 and 65.22 respectively in the unrestricted setting, and advances GYAFC benchmark's BLEU to 74.24 (2.23 absolute improvement) in E&M domain and 77.97 (2.64 absolute improvement) in F&R domain.

研究动机与目标

  • 解决在句子重写任务中,同时训练时增强数据中的噪声和错误编辑可能误导模型的问题。
  • 通过在真实数据上微调前,先在多样化增强数据上进行预训练,以提升模型的泛化能力和性能。
  • 开发并评估多种专用于句子重写的增强技术,包括回译、特征判别和多任务迁移。
  • 通过实证验证,预训练使用增强数据优于同时使用真实数据与增强数据进行联合训练的策略。
  • 在标准基准上实现语法错误修正(GEC)与正式风格转换(FST)任务的最先进性能。

提出的方法

  • 模型先在通过数据增强技术生成的合成增强句对上进行预训练,随后在标准真实数据上进行微调。
  • 引入三种数据增强方法:回译用于生成改写后的句对,特征判别用于筛选高质量的正式化增强句对,多任务迁移则利用GEC数据提升正式风格转换性能。
  • 预训练阶段利用增强数据学习上下文表征与转换模式,避免受噪声编辑的污染。
  • 微调阶段仅使用真实数据,以确保模型对正确编辑的信任,并与目标分布保持一致。
  • 该框架将数据使用划分为不同阶段,防止模型从增强数据中的错误编辑中学习。
  • 该方法在两大主要句子重写任务上进行评估:语法错误修正(GEC)与正式风格转换(FST)。

实验结果

研究问题

  • RQ1在句子重写任务中,先在增强数据上预训练再在真实数据上微调,是否优于同时使用两类数据进行联合训练?
  • RQ2多种数据增强策略——包括回译、特征判别和多任务迁移——是否能提升句子重写任务中模型的泛化能力与性能?
  • RQ3当仅使用增强数据或仅使用真实数据进行训练时,模型在句子重写任务中的性能如何变化?
  • RQ4所提方法在CoNLL-2014、JFLEG和GYAFC等标准基准上的最先进结果提升程度如何?
  • RQ5为何联合使用增强数据会降低句子重写任务的性能?两阶段方法如何缓解此问题?

主要发现

  • 所提出的预训练与微调方法在无限制训练设置下,于CoNLL-2014基准上达到新的最先进F0.5分数66.77,超越先前方法。
  • 在JFLEG基准上,模型在无限制设置下取得65.22的GLEU分数,显著优于先前工作。
  • 在GYAFC基准上,模型在E&M领域BLEU分数提升2.23点(达到74.24),在F&R领域提升2.64点(达到77.97)。
  • 仅在增强数据上训练的模型在WMT14英德翻译任务上取得28.8的BLEU分数,与真实数据表现相当,但在句子重写任务中因编辑噪声而表现不佳。
  • 两阶段训练策略有效防止模型从增强数据中的错误编辑中学习,因此性能优于联合训练。
  • 特征判别与多任务迁移的整合显著提升了增强数据的质量与相关性,尤其在正式风格转换任务中效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。