[论文解读] Improving Neural Text Simplification Model with Simplified Corpora
本文提出一种基于回译的改进方法,通过利用大规模简化语料库,在不修改神经网络架构的前提下提升神经文本简化(NTS)模型的性能。通过从简化句子生成合成的普通句子对,该方法在WikiLarge数据集上显著提升了BLEU(+2.11)、SARI(+1.07)和FKGL(-1.7),并取得了新的SOTA结果,表明当通过回译方式使用时,简化语料库可有效提升NTS性能。
Text simplification (TS) can be viewed as monolingual translation task, translating between text variations within a single language. Recent neural TS models draw on insights from neural machine translation to learn lexical simplification and content reduction using encoder-decoder model. But different from neural machine translation, we cannot obtain enough ordinary and simplified sentence pairs for TS, which are expensive and time-consuming to build. Target-side simplified sentences plays an important role in boosting fluency for statistical TS, and we investigate the use of simplified sentences to train, with no changes to the network architecture. We propose to pair simple training sentence with a synthetic ordinary sentence via back-translation, and treating this synthetic data as additional training data. We train encoder-decoder model using synthetic sentence pairs and original sentence pairs, which can obtain substantial improvements on the available WikiLarge data and WikiSmall data compared with the state-of-the-art methods.
研究动机与目标
- 通过利用大规模简化语料库,解决神经文本简化(NTS)中平行普通-简化句子对稀缺的问题。
- 在不修改神经网络架构的前提下,提升NTS模型的性能。
- 探究简化语料库是否能提升基于NMT的文本简化中的流畅性与简化质量。
- 探索回译在从简化句子生成合成训练数据方面的有效性。
- 建立一种简单、可迁移的方法,将简化语料库整合到现有NTS框架中。
提出的方法
- 通过使用预训练的NMT模型对10万条简化句子的随机样本进行回译,生成合成的普通句子对。
- 将合成的句子对与原始的平行训练数据结合,用于NMT模型的联合训练。
- 使用OpenNMT框架训练NMT模型,采用基于注意力机制的编码器-解码器架构、LSTM层和标准超参数。
- 该方法将回译生成的句子视为额外训练数据,有效增加了训练集的规模与多样性。
- 未对基础NMT模型进行任何架构修改;该方法与现有NTS系统兼容。
- 训练过程混合真实平行数据与合成数据,以提升泛化能力与简化质量。
实验结果
研究问题
- RQ1当平行数据稀缺时,能否有效利用简化语料库来提升神经文本简化模型的性能?
- RQ2将简化句子回译为普通形式是否能带来NTS性能的实质性提升?
- RQ3在不修改架构的前提下,利用简化语料库生成的合成数据是否能超越现有SOTA方法?
- RQ4引入简化语料库对生成文本的流畅性、语法正确性与简化程度有何影响?
- RQ5该方法是否在不同数据集(如WikiLarge和WikiSmall)上具有良好的泛化能力?
主要发现
- 在WikiLarge数据集上,NMT+synthetic模型相比基线NMT模型,BLEU得分提升了2.11点。
- NMT+synthetic模型将Flesch-Kincaid Grade Level(FKGL)降低了1.7点,表明可读性得到改善。
- 该模型相比基线模型,SARI得分提升了1.07点,表明语义保留能力更强。
- 人工评估显示,NMT+synthetic模型的Simplicity得分提高了0.42,显著优于PBMT-R、Dress和SBMT-SARI。
- 在WikiSmall数据集上,该方法相比基线NMT模型实现了6.37点的BLEU得分提升,表明在小规模数据集上也表现出强劲增益。
- NMT+synthetic模型在WikiLarge和WikiSmall数据集上均取得了新的SOTA结果,超越了此前报道的SOTA模型(如Dress和SBMT-SARI)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。