[论文解读] Corpus Augmentation by Sentence Segmentation for Low-Resource Neural Machine Translation
本文提出了一种新颖的低资源神经机器翻译(NMT)语料增强方法,该方法将长平行句分割为部分句子,对目标端部分句子进行反向翻译以生成伪平行句对,并将其与原始数据结合。该方法在不使用单语数据或修改网络架构的情况下,相较于基线模型及现有的反向翻译基线,BLEU分数提升了1.5–2.5分。
Neural Machine Translation (NMT) has been proven to achieve impressive results. The NMT system translation results depend strongly on the size and quality of parallel corpora. Nevertheless, for many language pairs, no rich-resource parallel corpora exist. As described in this paper, we propose a corpus augmentation method by segmenting long sentences in a corpus using back-translation and generating pseudo-parallel sentence pairs. The experiment results of the Japanese-Chinese and Chinese-Japanese translation with Japanese-Chinese scientific paper excerpt corpus (ASPEC-JC) show that the method improves translation performance.
研究动机与目标
- 提升平行语料规模小且质量差的低资源语言对的神经机器翻译性能。
- 开发一种语料增强技术,以提升训练数据质量,且不依赖单语数据或修改NMT架构。
- 探究将长句子分割并反向翻译部分句子是否能生成有效的伪平行句对用于训练。
- 在日语-中文科技论文语料库(ASPEC-JC)这一低资源设置下评估该方法的有效性。
提出的方法
- 使用标点符号分割法将包含多个标点符号的长平行句子分割为部分句子对。
- 利用 fast_align 提取源端与目标端部分句子之间的词对齐信息,并进行对称化处理以确定句子片段的对应关系。
- 使用现有的NMT模型将目标端的部分句子反向翻译回源语言,以生成伪源句子。
- 将生成的伪平行句对与原始训练数据混合,以增加有效训练规模。
- 该方法在基于字符级LSTM的NMT模型上,分别应用于日语到中文和中文到日语的翻译方向。
- 通过与基线、复制数据、仅部分句子、标准反向翻译基线的BLEU分数对比,对方法进行评估。
实验结果
研究问题
- RQ1在低资源设置下,分割长句子并反向翻译部分句子是否能提升NMT性能?
- RQ2当无单语数据时,所提方法是否优于标准反向翻译?
- RQ3性能提升是源于伪平行句对的生成,还是仅仅由于数据复制?
- RQ4该方法能否与其他增强技术结合,以进一步提升翻译质量?
主要发现
- 在日语-中文和中文-日语两个翻译方向上,所提方法在BLEU分数上均优于基线、复制数据、仅部分句子和标准反向翻译基线。
- 在ASPEC-JC语料上,该方法相较基线使BLEU分数提升了1.5至2.5分,表明在两个翻译方向上均具有稳定增益。
- 即使在结合单语数据的情况下,该方法仍优于标准反向翻译,表明其作为互补增强策略的有效性。
- 性能提升归因于生成了有意义的伪平行句对,而非单纯的数据复制,这一点由“反向翻译”变体优于“复制”变体的结果得到证实。
- 该方法无需单语数据或架构修改,因此可广泛适用于各类NMT系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。