QUICK REVIEW
[论文解读] Parallel Data Augmentation for Formality Style Transfer
Yi Zhang, Tao Ge|arXiv (Cornell University)|May 14, 2020
Natural Language Processing Techniques参考文献 37被引用 4
一句话总结
本文提出了新颖的数据增强方法——正式性判别(F-Dis)、多任务迁移(M-Task)和回译,用于正式性风格转换(FST),通过利用合成平行数据显著提升了模型性能。当在GYAFC基准上用于预训练模型时,增强后的数据在自动评估和人工评估中均取得了最先进结果。
ABSTRACT
The main barrier to progress in the task of Formality Style Transfer is the inadequacy of training data. In this paper, we study how to augment parallel data and propose novel and simple data augmentation methods for this task to obtain useful sentence pairs with easily accessible models and systems. Experiments demonstrate that our augmented parallel data largely helps improve formality style transfer when it is used to pre-train the model, leading to the state-of-the-art results in the GYAFC benchmark dataset.
研究动机与目标
- 解决正式性风格转换(FST)中平行训练数据有限的关键瓶颈问题,现有数据集如GYAFC仅包含约10万对句子。
- 通过使用可访问的模型与系统生成多样化、高质量的合成平行句子对,克服数据稀缺问题。
- 通过引入原始训练数据中不存在的正式性转换知识,提升FST模型的泛化能力并减少过拟合。
- 证明使用增强数据进行预训练可在GYAFC基准上实现最先进性能,超越现有方法,在自动评估与人工评估指标上均表现更优。
提出的方法
- 通过在原始平行数据上训练一个从正式到非正式的序列到序列模型,再利用该模型将正式输入转换为合成的非正式句子,从而形成新的(非正式,正式)句子对,实现回译。
- 通过将非正式句子经由中间语言(如法语、德语、中文)翻译,并使用训练好的基于CNN的正式性判别器筛选出重译后句子正式性显著提升的样本对,实现正式性判别(F-Dis)。
- 通过利用现有的语法错误纠正(GEC)数据集,对FST模型进行预训练或微调,以利用非正式文本中的不规范现象与GEC中纠正模式之间的重叠,实现多任务迁移(M-Task)。
- 采用阈值化正式性得分差异选择增强数据:若 $P_+(\bm{s}_i') - P_+(\bm{s}_i) \geq \sigma$,则 $(\bm{s}_i, \bm{s}_i') \in \mathcal{T}_{\text{aug}}$,其中 $\sigma = 0.6$。
- 在原始数据与增强数据的组合上对最终FST模型进行预训练,以提升泛化能力并改善下游评估性能。
- 使用自动评估指标(BLEU)和人工评估(正式性、流畅性、语义保留)对模型进行评估,并与强基线方法如NMT-MTL和GPT-CAT进行对比。
实验结果
研究问题
- RQ1尽管原始平行数据有限,数据增强技术是否能显著提升正式性风格转换模型的性能?
- RQ2正式性判别与多任务迁移在生成高质量合成平行数据方面有多高效,能否捕捉原始数据中不存在的正式性转换知识?
- RQ3不同中间语言(如法语、德语、中文)对F-Dis方法中增强数据的质量与数量有何影响?
- RQ4使用增强数据进行预训练是否能在自动与人工评估指标上带来可测量的性能提升?
- RQ5在正式性转换质量与流畅性保留方面,所提方法与现有最先进模型相比表现如何?
主要发现
- 所提出的F-Dis、M-Task与回译等数据增强方法生成了大规模、高质量的合成平行数据,显著扩展了FST的训练信号。
- 使用增强数据进行预训练在GYAFC基准上实现了最先进性能,自动评估中超越了基线模型与现有SOTA方法。
- 人工评估显示,所提模型在正式性得分上达到1.45(p < 0.05),流畅性为1.85(p < 0.05),语义保留为1.92(p < 0.05),均显著优于原始数据。
- 在不同中间语言中,基于德语的F-Dis表现最佳(F&R数据集上BLEU为75.18),在数据质量与规模之间取得良好平衡;而基于中文的F-Dis生成的数据集最大(68万对),但因分词歧义导致噪声较高。
- 当使用德语作为中间语言的F-Dis时,模型在E&M数据集上BLEU得分为74.52,在F&R数据集上为75.18,均优于原始数据(分别为69.44与74.19)。
- 数据增强与预训练的结合使模型具备更强泛化能力,减少了过拟合,提升了风格转换的鲁棒性,且无需修改网络架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。