[论文解读] Improving Back-Translation with Uncertainty-based Confidence Estimation
本文通过利用蒙特卡洛丢弃(Monte Carlo Dropout)在词和句子层面量化模型不确定性,提出了一种基于不确定性的置信度估计方法,用于低资源神经机器翻译中的回译(back-translation)。通过使用基于预测方差的置信度分数过滤噪声合成的单语翻译,该方法在无需标注数据或外部模型的情况下,显著提升了中文-英文和英文-德语任务的翻译性能。
While back-translation is simple and effective in exploiting abundant monolingual corpora to improve low-resource neural machine translation (NMT), the synthetic bilingual corpora generated by NMT models trained on limited authentic bilingual data are inevitably noisy. In this work, we propose to quantify the confidence of NMT model predictions based on model uncertainty. With word- and sentence-level confidence measures based on uncertainty, it is possible for back-translation to better cope with noise in synthetic bilingual corpora. Experiments on Chinese-English and English-German translation tasks show that uncertainty-based confidence estimation significantly improves the performance of back-translation.
研究动机与目标
- 解决在低资源神经机器翻译中回译过程中生成的噪声合成双语数据问题。
- 开发一种不依赖外部模型或标注数据的置信度估计方法,以量化模型不确定性。
- 通过使用基于不确定性的置信度分数过滤低置信度、易出错的合成翻译,提升回译性能。
- 使该方法能够普遍适用于不同的神经机器翻译架构和语言对。
提出的方法
- 使用蒙特卡洛丢弃进行多次前向传播,以估计词和句子层面的翻译概率方差。
- 基于丢弃采样结果,使用预测方差(VAR)和基于熵的度量(CEV)计算词级置信度。
- 通过加权平均和归一化,将词级置信度聚合为句子级置信度分数。
- 应用置信度阈值,过滤掉低置信度的合成翻译,再重新训练神经机器翻译模型。
- 通过在最终训练数据中排除低置信度的合成句子对,将置信度估计集成到回译流程中。
- 先在真实双语数据上训练目标语言到源语言的模型,然后利用其从单语数据生成合成源语句子,再在与真实数据合并前应用置信度过滤。
实验结果
研究问题
- RQ1通过蒙特卡洛丢弃估计的模型不确定性是否能有效识别回译中不可靠的神经机器翻译预测?
- RQ2基于不确定性的置信度过滤如何提升低资源设置下合成双语数据的质量?
- RQ3基于不确定性的置信度估计是否能普遍适用于不同的神经机器翻译架构和语言对,而无需标注数据?
- RQ4将基于不确定性的过滤与现有数据选择策略(如针对难词)结合,是否能带来进一步性能提升?
- RQ5不同基于不确定性的置信度度量(如方差、熵)在识别翻译错误方面表现如何比较?
主要发现
- 所提出的基于不确定性的置信度估计方法在中文-英文和英文-德语翻译任务中显著提升了回译性能。
- 在 IWSLT14 英文-德语翻译任务中,该方法达到 BLEU 得分为 31.17,较基线提升 1.25 分。
- 在 IWSLT14 中文-英文翻译任务中,该方法达到 BLEU 得分为 30.72,较基线提升 1.18 分。
- 在 NIST06 英文-德语测试集上,当与不确定性过滤结合时,BLEU 从 46.60(使用数据选择)提升至 47.18。
- 基于方差的置信度度量(VAR、CEV)在识别低置信度、易出错预测方面优于 PTP 和 EXP。
- 即使与先进数据选择技术(如针对难词)结合,该方法仍表现有效,表明其与现有回译增强方法具有强兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。