[论文解读] On Compositionality in Neural Machine Translation
本文将神经机器翻译中组合性表现不佳的原因归因于编码器表征不足,提出一种简单的词袋预训练方法以提升模型在生产力与系统性任务上的性能。该方法通过强制编码器更好地捕捉输入词的存在性,显著提升BLEU分数——在系统性任务上提升16.39分,在生产力任务上提升1.9 BLEU分。
We investigate two specific manifestations of compositionality in Neural Machine Translation (NMT) : (1) Productivity - the ability of the model to extend its predictions beyond the observed length in training data and (2) Systematicity - the ability of the model to systematically recombine known parts and rules. We evaluate a standard Sequence to Sequence model on tests designed to assess these two properties in NMT. We quantitatively demonstrate that inadequate temporal processing, in the form of poor encoder representations is a bottleneck for both Productivity and Systematicity. We propose a simple pre-training mechanism which alleviates model performance on the two properties and leads to a significant improvement in BLEU scores.
研究动机与目标
- 探究标准序列到序列模型在神经机器翻译中是否表现出真正的组合性。
- 诊断组合性任务表现不佳的原因是否源于编码器表征中时间处理能力不足。
- 提出一种预训练机制,以增强编码器表征,从而改善系统性泛化与生产力。
- 评估改进表征对神经机器翻译中BLEU分数与组合性泛化的影响。
提出的方法
- 使用词汇表上的Sigmoid输出层,预训练编码器以预测输入句子的词袋表征。
- 使用交叉熵损失函数,最小化预测与真实词存在向量之间的差异。
- 在掩码目标下训练编码器,其中输入序列中每个词的存在性被标记为0或1。
- 在机器翻译微调前,使用预训练的编码器权重初始化完整的Seq2Seq模型。
- 在两个组合性任务上评估模型:翻译拼接的句子对(生产力)与翻译包含未见词的句子(系统性)。
- 使用前馈网络探测编码器表征中的词存在性与子串检测,以验证表征质量。
实验结果
研究问题
- RQ1标准Seq2Seq模型在翻译中是否能超越训练长度进行泛化,表明其具备生产力?
- RQ2当面对未见的词组合时,Seq2Seq模型能否系统性地重组已知部分与规则?
- RQ3编码器表征不佳在多大程度上限制了模型在神经机器翻译中执行组合性泛化的能⼒?
- RQ4在词袋表征目标上预训练编码器,能否提升组合性泛化与BLEU分数?
主要发现
- 标准Seq2Seq模型在拼接句子对上的BLEU得分为27.50,相比单句基线的30.19下降了2.69 BLEU分,表明其生产力表现较差。
- 模型的编码器在长序列中无法保留早期词的信息,表现为在最终隐藏状态处重建首句词袋表征的表现不佳。
- 在系统性任务中,模型仅在12.25%的情况下正确预测出词'daxy',而使用预训练编码器的模型则达到50%。
- 词袋预训练方法使生产力任务的BLEU得分从24.5提升至26.4,p值为0.011,具有统计显著性。
- 在系统性任务中,预训练模型的BLEU得分为52.53,而基线模型为36.14,显示出显著提升。
- 预训练编码器提升了未见词检测的精确率与召回率,表明其对词汇表外元素的表征泛化能力更强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。