[论文解读] Adaptation of Machine Translation Models with Back-translated Data using Transductive Data Selection Methods
本文提出在回译生成的合成数据上应用归纳式数据选择方法——稀有n-gram恢复(INR)与特征衰减算法(FDA),以适应通用领域神经机器翻译(NMT)模型至特定领域。尽管回译数据存在噪声,但基于与测试集n-gram重叠度选择合成句子可提升翻译性能,其中在线处理方式(使用近似目标侧翻译作为种子)优于批量处理方式。
Data selection has proven its merit for improving Neural Machine Translation (NMT), when applied to authentic data. But the benefit of using synthetic data in NMT training, produced by the popular back-translation technique, raises the question if data selection could also be useful for synthetic data? In this work we use Infrequent N-gram Recovery (INR) and Feature Decay Algorithms (FDA), two transductive data selection methods to obtain subsets of sentences from synthetic data. These methods ensure that selected sentences share n-grams with the test set so the NMT model can be adapted to translate it. Performing data selection on back-translated data creates new challenges as the source-side may contain noise originated by the model used in the back-translation. Hence, finding n-grams present in the test set become more difficult. Despite that, in our work we show that adapting a model with a selection of synthetic data is an useful approach.
研究动机与目标
- 探究归纳式数据选择(TDS)方法是否能通过合成回译数据提升NMT模型适应性能。
- 比较将TDS应用于合成数据时的批量与在线处理策略,重点关注效率与有效性。
- 评估使用测试集近似目标侧翻译作为种子是否能提升数据选择质量,即使存在潜在翻译错误。
- 分析回译数据中的噪声对n-gram恢复与选择性能的影响。
- 确定通过TDS选择的合成数据是否能在NMT适应任务中优于或补充真实领域内数据。
提出的方法
- 应用稀有n-gram恢复(INR)方法,通过测试集中存在的稀有n-gram对合成句子进行评分,并对已选句子施加惩罚。
- 使用特征衰减算法(FDA)通过奖励与测试集的n-gram重叠度来评分句子,同时对频繁选择的n-gram降低其得分。
- 实现两种处理模式:批量模式(先回译全部单语数据集,再进行选择)与在线模式(先选择单语句子,再进行回译)。
- 使用通用领域NMT模型生成测试集的近似目标侧翻译,作为源侧不可用时TDS的种子。
- 在使用TDS选择的合成数据微调后,通过在保留测试集上的BLEU分数评估模型性能。
- 结合来自源侧和近似目标侧种子的TA输出,以提升覆盖度与相关性。
实验结果
研究问题
- RQ1归纳式数据选择方法(如INR与FDA)能否有效应用于合成回译数据以实现NMT模型适应?
- RQ2在线处理方式——即在回译前先选择单语句子——是否优于完全回译后的批量处理方式?
- RQ3使用测试集近似目标侧翻译作为种子,与直接使用实际源侧测试集相比,在数据选择质量与下游翻译性能方面表现如何?
- RQ4回译数据中的噪声在多大程度上影响TDS方法恢复相关n-gram及提升模型适应能力?
- RQ5通过TDS选择的合成数据是否能在领域适应任务中优于或补充真实领域内数据?
主要发现
- 在线处理方式(即先选择单语句子再进行回译)在BLEU分数提升方面始终优于批量处理方式。
- 尽管存在潜在翻译错误,使用测试集近似目标侧翻译作为TDS种子的性能仍优于直接使用源侧测试集。
- 使用近似目标侧种子的FDA算法($FDA_{trg}$)生成的翻译比$FDA_{src}$更接近参考译文,尤其在保留“rehearsal room”等语境关键术语方面表现更优。
- 即使回译句子包含不自然的n-gram(如将‘Hüpfburg’误译为‘bounmit’),TDS方法仍能通过部分n-gram重叠识别出相关句子。
- 本研究证明,即使数据为人工生成且可能存在噪声,通过TDS选择的合成数据仍能提升模型性能,表明该方法具有鲁棒性。
- 结合$TA_{src}$与$TA_{trg}$的输出可提升覆盖度,并带来更优的整体适应效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。