Skip to main content
QUICK REVIEW

[论文解读] Dynamic Data Selection and Weighting for Iterative Back-Translation

Zi-Yi Dou, Antonios Anastasopoulos|arXiv (Cornell University)|Apr 7, 2020
Natural Language Processing Techniques参考文献 40被引用 8
一句话总结

该论文提出了一种用于迭代回译的动态课程学习策略,通过根据目标领域代表性自适应选择单语句子,并根据翻译质量对回译数据进行加权,从而提升泛化能力。该方法在德语-英语和立陶宛语-英语翻译任务的领域自适应、低资源和高资源设置中,相较于强基线模型,性能最高提升1.8 BLEU分。

ABSTRACT

Back-translation has proven to be an effective method to utilize monolingual data in neural machine translation (NMT), and iteratively conducting back-translation can further improve the model performance. Selecting which monolingual data to back-translate is crucial, as we require that the resulting synthetic data are of high quality and reflect the target domain. To achieve these two goals, data selection and weighting strategies have been proposed, with a common practice being to select samples close to the target domain but also dissimilar to the average general-domain text. In this paper, we provide insights into this commonly used approach and generalize it to a dynamic curriculum learning strategy, which is applied to iterative back-translation models. In addition, we propose weighting strategies based on both the current quality of the sentence and its improvement over the previous iteration. We evaluate our models on domain adaptation, low-resource, and high-resource MT settings and on two language pairs. Experimental results demonstrate that our methods achieve improvements of up to 1.8 BLEU points over competitive baselines.

研究动机与目标

  • 为解决迭代回译中静态数据选择的局限性,即固定选择标准可能无法有效代表目标领域。
  • 通过动态选择逐渐从通用领域分布过渡到目标领域分布的单语数据,提升模型泛化能力。
  • 通过引入基于质量的加权方案,降低低质量回译带来的噪声影响,从而减少其负面影响。
  • 在低资源、高资源和领域自适应等多种机器翻译设置下,评估所提出的动态选择与加权策略的有效性。
  • 提供实证与定性分析,确认所选数据更有效地代表目标分布,且加权策略能提升在噪声环境下的鲁棒性。

提出的方法

  • 动态数据选择以课程学习策略实现,即在每个训练周期选择不同的单语句子子集,逐步从通用领域数据过渡到目标领域数据。
  • 选择过程结合了代表性(如LM-in或TF-IDF)与简洁性(如R-BLEU)指标,以识别接近目标分布、且不太可能为 OOV(未登录词)或噪声的句子。
  • 通过在训练周期中动态调整选择阈值,强制实施动态课程学习,确保回译模型在每个阶段都能可靠地翻译所选句子。
  • 基于回译质量对数据进行加权,权重反映当前翻译质量以及相较于前一迭代的改进程度。
  • 该方法整合了选择与加权策略,其中选择强调领域相关性,加权强调翻译保真度。
  • 该方法应用于迭代回译框架中,交替使用真实与合成的平行数据进行前向与后向翻译训练。

实验结果

研究问题

  • RQ1能否通过在训练周期中动态演化数据选择的策略,提升迭代回译中的领域自适应性能?
  • RQ2结合代表性与简洁性指标是否能比静态选择方法更优地筛选出目标领域单语句子?
  • RQ3基于质量的数据加权方案在多大程度上能减轻低质量回译在迭代回译中的负面影响?
  • RQ4所提出方法在低资源、高资源及领域自适应场景下的表现如何?
  • RQ5所选数据是否能有效代表目标分布?加权策略是否在噪声环境中提升性能?

主要发现

  • 所提出的动态课程学习策略在低资源设置下,相较于强基线模型,性能最高提升1.8 BLEU分。
  • 在高资源设置下,该方法将基线性能提升最高达0.6 BLEU分,表明在不同数据规模下均具有一致性增益。
  • 动态选择策略在各周期中至少一次引入了52.5%的单语句子,且每轮有12.5%至21.5%的所选句子被替换,表明具有良好的多样性与演化能力。
  • 所选句子在目标分布代表性方面表现优异,经Hellinger距离与长度分析验证,高质量样本通常较短,且符合目标领域特征。
  • 在噪声环境中,加权策略最为有效,能显著降低低质量回译的影响,提升模型鲁棒性。
  • 在所有设置下,采用LM-in与LM-gen组合进行选择,以及TF-IDF与R-BLEU组合进行代表性与简洁性评估,可获得最佳性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。