[论文解读] An Empirical Exploration of Curriculum Learning for Neural Machine Translation
本文研究了一个用于德英NMT的概率型课程学习框架,显示在不损失BLEU的前提下可能加速收敛,但结果对课程设计和超参数高度敏感。
Machine translation systems based on deep neural networks are expensive to train. Curriculum learning aims to address this issue by choosing the order in which samples are presented during training to help train better models faster. We adopt a probabilistic view of curriculum learning, which lets us flexibly evaluate the impact of curricula design, and perform an extensive exploration on a German-English translation task. Results show that it is possible to improve convergence time at no loss in translation quality. However, results are highly sensitive to the choice of sample difficulty criteria, curriculum schedule and other hyperparameters.
研究动机与目标
- 通过探索课程学习来降低数据驱动型神经机器翻译系统的训练时间的动机。
- 提出一个概率性课程框架,以阶段相关的概率选择训练样本(q_i^t)来形成课程。
- 评估一系列难度标准和调度,了解它们对收敛和BLEU的影响。
- 在使用Sockeye NMT工具包的德国–英文TED演讲数据上评估课程学习。
- 为在NMT设置中设计课程提供实用指导与局限性。
提出的方法
- 采用一种概率视角,即每个训练样本在给定时间具有被选择的概率 (q_i^t) 来形成课程。
- 将数据组织成具有相似难度的分块,以简化调度和采样。
- 定义难度标准,包括基于模型的(单一最佳分数 p(y_hat|x))和语言特征(句子长度、词频排名)。
- 实例化若干课程调度(默认/从易到难、反向、提升、降低、无洗牌)以研究它们在跨时代或阶段的影响。
- 在德国–英文TED演讲数据上使用Sockeye训练NMT模型,嵌入512维,编码器/解码器为LSTM,BPE-30k,并将课程变体与标准基线进行比较。
- 在固定数量的批次后更新课程并在验证困惑度稳定之前继续训练。
实验结果
研究问题
- RQ1课程学习是否可以在不牺牲翻译质量(BLEU)的前提下加速NMT模型的收敛?
- RQ2哪些难度标准(基于模型的 vs 语言的)和哪些课程调度在不同超参数下最能改善收敛?
- RQ3课程结果对学习率和课程更新频率等超参数有多敏感?
主要发现
- 对于某些配置,课程学习可以在不损失BLEU的情况下提高收敛速度;在基线之上有20/100个课程在不损失BLEU的情况下更早收敛。
- 课程的效果对超参数高度敏感;在不同设定下没有单一策略始终占优。
- 基于平均词频的难度和反向调度的情况下,训练时间提高约19%–30%。
- 在较高学习率(0.002)时,使用提升策略的单一最佳分数比提升速度快了19%(59k vs 73k批次),BLEU为28.4而非28.1;在lr=0.0008时,某些课程在速度提升的同时达到或超过基线BLEU。
- 基于句子长度的标准在收敛时提供的利益有限或属于早期阶段,未在收敛时显著改善收敛时间。
- 总体而言,简单的长度或频率基准可以与更昂贵的标准同样有效,且不存在普遍最优的课程;超参数对结果的影响很大。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。