[论文解读] Improving Grammatical Error Correction with Machine Translation Pairs
本文提出了一种新颖的语法错误修正(GEC)数据合成方法,利用一对机器翻译模型——一个低质量模型(模拟英语作为第二语言学习者)和一个高质量模型(生成流畅、语法正确的输出)——从单语源文本中生成多样化、真实的错误-修正句子对。该方法优于现有的数据增强技术,并通过生成高多样性、低偏差的错误模式,无需依赖规则集或种子平行数据,在BEA-19和CoNLL-14基准上使GEC模型达到最先进性能。
We propose a novel data synthesis method to generate diverse error-corrected sentence pairs for improving grammatical error correction, which is based on a pair of machine translation models of different qualities (i.e., poor and good). The poor translation model resembles the ESL (English as a second language) learner and tends to generate translations of low quality in terms of fluency and grammatical correctness, while the good translation model generally generates fluent and grammatically correct translations. We build the poor and good translation model with phrase-based statistical machine translation model with decreased language model weight and neural machine translation model respectively. By taking the pair of their translations of the same sentences in a bridge language as error-corrected sentence pairs, we can construct unlimited pseudo parallel data. Our approach is capable of generating diverse fluency-improving patterns without being limited by the pre-defined rule set and the seed error-corrected data. Experimental results demonstrate the effectiveness of our approach and show that it can be combined with other synthetic data sources to yield further improvements.
研究动机与目标
- 解决现有GEC数据合成方法的局限性,这些方法由于依赖固定规则或种子平行数据,仅能生成有限范围的错误模式。
- 开发一种数据增强技术,可生成多样化、真实的语法错误-修正对,而无需人工标注的错误数据。
- 通过在模拟第二语言英语学习者错误模式的合成数据上进行预训练,提升GEC模型性能。
- 探索一种新的GEC数据合成范式,利用低质量与高质量翻译模型之间的对比,生成高质量、多样化的训练样本。
提出的方法
- 训练一个短语基于的SMT模型,降低语言模型权重,使其充当‘初学者’翻译器,生成低流畅度、语法错误的翻译,类似于英语作为第二语言学习者的输出。
- 使用最先进的NMT模型作为‘高级’翻译器,为相同源句生成流畅、语法正确的翻译。
- 将SMT生成的(有错误的)翻译与NMT生成的(正确的)翻译配对,形成合成的错误-修正句子对。
- 利用生成的合成对对GEC模型进行预训练,借助两台MT模型之间对比所诱导出的多样化错误模式。
- 通过在两台MT模型中使用相同的源句,确保语义一致性,从而在最大程度上减少语义漂移,同时最大化语法差异。
- 在BEA-19和CoNLL-14基准上评估该方法,与基于规则的、回译法、维基百科修订法以及往返翻译法等现有数据合成方法进行性能对比。
实验结果
研究问题
- RQ1一对质量水平不同的机器翻译模型能否生成多样化且真实的语法错误-修正句子对,以用于GEC的数据增强?
- RQ2与基于规则的污染、回译法、维基百科修订法及往返翻译法等现有数据合成技术相比,所提方法在性能上表现如何?
- RQ3通过低质量与高质量MT模型配对生成的合成数据,在多大程度上能提升GEC模型在标准基准上的性能?
- RQ4该方法生成的错误模式是否比现有方法更贴近真实英语第二语言学习者的错误?
- RQ5该方法是否能在不依赖大规模人工标注错误-修正数据集的情况下,实现最先进水平的GEC性能?
主要发现
- 所提方法生成的多样化错误-修正句子对能有效补充现有数据合成技术,提升GEC模型的泛化能力。
- 由低质量(SMT)与高质量(NMT)MT模型对生成的合成数据,在BEA-19和CoNLL-14基准上显著提升了GEC模型的性能。
- 当用于预训练时,该方法在BEA-19和CoNLL-14基准上实现了最先进水平的单模型性能。
- 在错误模式的多样性与有效性方面,该方法优于基于规则的污染、回译法、维基百科修订法及往返翻译法。
- 该方法避免了语义漂移,同时在修正句中保持了高流畅度,且引入了真实的语法错误,经自动评估与人工评估验证。
- 性能提升可归因于SMT模型的字面化、易出错的翻译与NMT模型流畅、语法正确的输出之间的对比,二者共同生成了高质量的合成数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。