[论文解读] Cost-Effective Training in Low-Resource Neural Machine Translation
本文提出了一种低成本的训练框架,用于低资源神经机器翻译(NMT),通过结合单语预训练、小规模双语词典集成以及一种新颖的主动学习(AL)策略。该方法通过利用交叉熵差异采样并冻结预训练期间的嵌入层,在极低标注预算(0–50k句对)下,相较于传统AL方法,实现了最高达13 BLEU的性能提升。
While Active Learning (AL) techniques are explored in Neural Machine Translation (NMT), only a few works focus on tackling low annotation budgets where a limited number of sentences can get translated. Such situations are especially challenging and can occur for endangered languages with few human annotators or having cost constraints to label large amounts of data. Although AL is shown to be helpful with large budgets, it is not enough to build high-quality translation systems in these low-resource conditions. In this work, we propose a cost-effective training procedure to increase the performance of NMT models utilizing a small number of annotated sentences and dictionary entries. Our method leverages monolingual data with self-supervised objectives and a small-scale, inexpensive dictionary for additional supervision to initialize the NMT model before applying AL. We show that improving the model using a combination of these knowledge sources is essential to exploit AL strategies and increase gains in low-resource conditions. We also present a novel AL strategy inspired by domain adaptation for NMT and show that it is effective for low budgets. We propose a new hybrid data-driven approach, which samples sentences that are diverse from the labelled data and also most similar to unlabelled data. Finally, we show that initializing the NMT model and further using our AL strategy can achieve gains of up to $13$ BLEU compared to conventional AL methods.
研究动机与目标
- 解决在极低标注预算(0–50k句对)下构建高质量NMT系统的挑战,尤其针对低资源或濒危语言。
- 克服现有主动学习(AL)方法在假设大规模预算下运行的局限性,这些方法在低资源场景下表现不佳。
- 通过在预训练阶段整合单语数据和低成本双语词典作为辅助知识源,提升模型性能。
- 设计一种新的数据驱动AL策略,通过平衡多样性与密度,最大化在低预算条件下的信息量。
- 证明在应用AL之前,使用单语数据和词典监督进行预训练是释放其在低资源场景下全部潜力的必要前提。
提出的方法
- 通过掩码语言建模(MLM)和无监督机器翻译(UNMT)使用单语数据预训练NMT模型,以初始化跨语言表示。
- 通过可微分词典投影层将一个小型、低成本的双语词典(1,146个条目)集成到模型中,以指导词级别对齐。
- 提出一种名为“交叉熵差异”的新颖AL策略,通过选择不确定性高且与未标注数据相似的句子,实现多样性与密度的平衡。
- 在整个预训练阶段(MLM、UNMT和微调)冻结嵌入层,以保留跨语言知识并防止灾难性遗忘。
- 采用混合数据驱动方法,同时从已标注数据集中采样具有多样性的句子,并选择与未标注数据最相似的句子,以提升选择质量。
- 在预训练期间应用回译和基于BPE的子词分词(DP-BPE),以处理罕见词并提升词典覆盖率。
实验结果
研究问题
- RQ1在标注预算有限的低资源设置下,使用单语数据和小规模词典进行预训练是否能显著提升NMT性能?
- RQ2所提出的“交叉熵差异”AL策略在低预算场景下与现有策略(如RTTL和n-gram重叠)相比表现如何?
- RQ3在多阶段预训练过程中冻结嵌入层对下游NMT性能有何影响?
- RQ4将单语数据、词典监督与主动学习相结合,是否能带来比单一组件更大的性能增益?
- RQ5能否有效利用小型、低成本词典来提升低资源NMT中罕见词的翻译能力和模型鲁棒性?
主要发现
- 在主动学习之前,使用单语数据和小规模词典(1,146个条目)进行预训练可带来显著性能提升,相较于传统AL方法最高实现13 BLEU的增益。
- 所提出的“交叉熵差异”AL策略在所有语言对上均达到与SOTA方法RTTL相当的性能,仅在卡纳达语中RTTL略胜一筹。
- 在整个预训练阶段(MLM、UNMT和微调)冻结嵌入层可获得最佳结果,在En→Kn翻译任务中达到27.3 BLEU,优于非冻结变体。
- n-gram重叠策略在所有设置下均未能提升性能,表明仅依赖多样性不足以实现有效的低资源NMT主动学习。
- 通过DP-BPE集成词典知识可提升模型对罕见词的预测能力,表现为对低频词的对齐与翻译效果更优。
- 结合单语预训练、词典集成与新型AL策略,可构建出一种鲁棒且成本效益高的端到端流水线,在严格标注约束下实现性能最大化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。