Skip to main content
QUICK REVIEW

[论文解读] Phrase-level Active Learning for Neural Machine Translation

Junjie Hu, Graham Neubig|arXiv (Cornell University)|Jun 21, 2021
Natural Language Processing Techniques参考文献 31被引用 7
一句话总结

本文提出了一种用于神经机器翻译(NMT)的混合主动学习方法,从领域内未标注数据中同时选择完整句子和单个短语进行人工标注,从而提高领域自适应效率。通过结合短语级和句子级选择,该方法在不确定性基线方法基础上实现了最高1.2 BLEU的性能提升,尤其在标注预算较低时表现更优。

ABSTRACT

Neural machine translation (NMT) is sensitive to domain shift. In this paper, we address this problem in an active learning setting where we can spend a given budget on translating in-domain data, and gradually fine-tune a pre-trained out-of-domain NMT model on the newly translated data. Existing active learning methods for NMT usually select sentences based on uncertainty scores, but these methods require costly translation of full sentences even when only one or two key phrases within the sentence are informative. To address this limitation, we re-examine previous work from the phrase-based machine translation (PBMT) era that selected not full sentences, but rather individual phrases. However, while incorporating these phrases into PBMT systems was relatively simple, it is less trivial for NMT systems, which need to be trained on full sequences to capture larger structural properties of sentences unique to the new domain. To overcome these hurdles, we propose to select both full sentences and individual phrases from unlabelled data in the new domain for routing to human translators. In a German-English translation task, our active learning approach achieves consistent improvements over uncertainty-based sentence selection methods, improving up to 1.2 BLEU score over strong active learning baselines.

研究动机与目标

  • 通过主动学习减少标注成本,以应对NMT中的领域偏移问题。
  • 克服仅选择完整句子时效率低下的问题,因为只有句子的部分内容具有信息量。
  • 将广泛应用于PBMT的短语级主动学习方法适配至需要完整序列训练的NMT系统。
  • 开发一种结合句子与短语选择的混合选择策略,以提升数据效率。
  • 在预算约束下评估将短语翻译整合到NMT微调中的有效性。

提出的方法

  • 提出一种混合主动学习策略,从未标注的领域内数据中同时选择完整句子和单个短语(最多4-gram)。
  • 使用句子嵌入相似度和基于不确定性的评分进行句子选择,使用短语级多样性与信息量进行短语选择。
  • 引入一种混合微调策略,结合真实短语翻译与通过在现有句子中替换短语生成的合成数据。
  • 采用上下文感知的短语集成技术,但发现其引入噪声,性能劣于更简单的方法。
  • 采用固定标注预算平衡句子与短语翻译,通过德语-英语医学和IT领域翻译任务的BLEU分数评估性能。
  • 使用在选定领域内数据上微调的预训练WMT NMT模型,通过数据增强和混合训练将短语翻译整合其中。

实验结果

研究问题

  • RQ1当与句子级选择结合时,短语级主动学习是否能提升NMT领域自适应性能?
  • RQ2在标注预算有限的情况下,混合选择策略与纯句子级或纯短语级选择相比表现如何?
  • RQ3在不修改模型架构的前提下,将短语翻译最优地整合到NMT训练中的方法是什么?
  • RQ4与真实短语翻译相比,使用通过短语替换生成的合成数据是否能提升性能?
  • RQ5短语选择策略的选择如何影响低资源领域自适应中的最终翻译质量?

主要发现

  • 混合选择策略始终优于纯句子级或纯短语级选择,在BLEU分数上最高可提升1.2分。
  • 当标注预算较小时,仅使用短语级选择的性能表现较差,但与句子选择结合后显著提升。
  • 使用真实短语翻译与通过短语替换生成的合成数据进行混合微调,优于仅使用合成数据训练,尤其在低预算下(如5K词)。
  • 上下文感知的短语集成方法(将句子上下文附加到短语翻译上)表现最差,可能因引入噪声所致。
  • 通过句子嵌入余弦相似度进行句子选择的性能更稳定,方差更低,优于基于不确定性的方法。
  • 随机采样仍为强基线,但混合方法在标注预算受限时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。