[论文解读] Addressing Exposure Bias With Document Minimum Risk Training: Cambridge at the WMT20 Biomedical Translation Task
本文提出文档最小风险训练(doc-MRT)以缓解在小规模、对齐不完美的Medline摘要上微调时的暴露偏差问题。通过使用基于风险的目标函数,直接在候选翻译与参考翻译之间优化翻译结果,doc-MRT在不使用集成模型的情况下实现了最先进性能——在英语到西班牙语翻译任务中排名第一,西班牙语到英语任务中排名第二,即使训练数据中包含噪声和嵌入标题的句子。
The 2020 WMT Biomedical translation task evaluated Medline abstract translations. This is a small-domain translation task, meaning limited relevant training data with very distinct style and vocabulary. Models trained on such data are susceptible to exposure bias effects, particularly when training sentence pairs are imperfect translations of each other. This can result in poor behaviour during inference if the model learns to neglect the source sentence. The UNICAM entry addresses this problem during fine-tuning using a robust variant on Minimum Risk Training. We contrast this approach with data-filtering to remove `problem' training examples. Under MRT fine-tuning we obtain good results for both directions of English-German and English-Spanish biomedical translation. In particular we achieve the best English-to-Spanish translation result and second-best Spanish-to-English result, despite using only single models with no ensembling.
研究动机与目标
- 解决由于Medline摘要中存在噪声和对齐不完美的句子对,导致低资源生物医学机器翻译中的暴露偏差问题。
- 评估最小风险训练(MRT)在处理包含内容错配或冗余内容(如嵌入的文章标题)的噪声训练数据时的有效性。
- 比较数据过滤与MRT微调在提升小领域生物医学数据翻译质量方面的有效性。
- 确定MRT是否能在包含问题样本(如嵌入标题的句子)的训练数据中,仍优于标准最大似然估计(MLE)微调。
提出的方法
- 仅使用最小风险训练(MRT)在Medline摘要上微调强预训练的神经机器翻译模型,通过最小化候选翻译的期望损失来优化翻译质量。
- 应用文档级别的MRT(doc-MRT),在训练过程中考虑整个文档,以增强对句子级对齐错误和噪声样本的鲁棒性。
- 使用基于风险的目标函数,根据候选翻译与参考翻译之间的差异更新模型参数,减少对标准参考词元的过度依赖。
- 实施数据过滤策略,从源端或目标端移除包含方括号标题(如[Title])的句子,并对比有无过滤的性能表现。
- 推理时使用束搜索(束宽4),并通过NLTK进行句子分割,以提升多句输入测试样本的输出质量。
- 使用SacreBLEU进行评估,采用不区分大小写、去分词的评分方式,并通过模型检查点平均来降低训练方差。
实验结果
研究问题
- RQ1当训练数据包含对齐不完美的句子对时,文档级别的最小风险训练是否能有效减少生物医学NMT中的暴露偏差?
- RQ2MRT微调是否在小规模、特定领域的生物医学数据上优于标准MLE微调,尤其是在数据包含如嵌入标题句子等噪声样本时?
- RQ3MRT对噪声训练数据是否具有鲁棒性?还是在对数据进行激进过滤以去除问题句子后性能提升更显著?
- RQ4冗余或内容错配的内容(如源端或目标端包含文章标题)是否对MLE造成负面影响,但对MRT无显著影响?
- RQ5MRT是否能在不使用集成模型的情况下实现最先进性能,即使基线MLE模型在某些语言对上表现不佳?
主要发现
- 在WMT20生物医学任务的所有系统中,英语到西班牙语翻译的最佳结果是由单一模型在全部Medline数据上使用doc-MRT微调后获得的。
- 相同的doc-MRT方法在西班牙语到英语翻译中取得了第二名的最佳结果,表明其在两个方向上均表现出色。
- 与最佳MLE模型相比,doc-MRT在所有语言对上的BLEU分数最高提升了0.8,即使使用完整且含噪声的训练集也表现优异。
- 对标题嵌入句子进行激进过滤提升了德语到英语的翻译性能,但对英语到德语和英语到西班牙语的性能造成了损害,表明此类数据可能具有积极作用。
- 在完整数据(含噪声样本)上进行MRT微调的表现优于相同数据上的MLE,且在过滤后的“无标题”数据上进行MRT的表现也几乎相当,显示出MRT对噪声的强鲁棒性。
- 在所有语言对中,MRT模型均为最佳或并列最佳,证实其在无需数据过滤的情况下有效缓解了暴露偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。