Skip to main content
QUICK REVIEW

[论文解读] Decoding-History-Based Adaptive Control of Attention for Neural Machine Translation

Junyang Lin, Shuming Ma|arXiv (Cornell University)|Feb 6, 2018
Natural Language Processing Techniques参考文献 9被引用 15
一句话总结

本文提出基于解码历史的自适应注意力控制(ACA),通过使用记忆向量追踪解码历史并动态控制注意力机制,减少重复翻译,提升神经机器翻译的准确性。实验表明,在中文-英文翻译任务上相比强基线模型提升3.61 BLEU,在英文-越南文翻译任务上提升1.17 BLEU。

ABSTRACT

Attention-based sequence-to-sequence model has proved successful in Neural Machine Translation (NMT). However, the attention without consideration of decoding history, which includes the past information in the decoder and the attention mechanism, often causes much repetition. To address this problem, we propose the decoding-history-based Adaptive Control of Attention (ACA) for the NMT model. ACA learns to control the attention by keeping track of the decoding history and the current information with a memory vector, so that the model can take the translated contents and the current information into consideration. Experiments on Chinese-English translation and the English-Vietnamese translation have demonstrated that our model significantly outperforms the strong baselines. The analysis shows that our model is capable of generating translation with less repetition and higher accuracy. The code will be available at https://github.com/lancopku

研究动机与目标

  • 为解决神经机器翻译模型中注意力机制因缺乏对过去生成内容的感知而导致重复翻译的问题。
  • 通过将解码历史——特别是过去的解码器隐藏状态和注意力对齐信息——融入注意力控制,提升翻译质量。
  • 开发一种能根据先前生成内容自适应调整的注意力机制,提升翻译的流畅性与准确性。
  • 证明建模当前输入与解码历史之间交互关系,可生成更连贯且冗余更少的翻译结果。

提出的方法

  • 引入一个记忆向量,通过解码器隐藏状态和前一时刻注意力向量更新,以编码解码历史信息。
  • 利用记忆向量调制当前注意力机制,使其在选择源语言上下文时能够考虑先前生成的翻译内容。
  • 通过将记忆向量融入查询向量,修改注意力能量计算方式,实现对注意力权重的动态控制。
  • 采用门控机制在每个解码步骤更新记忆向量,整合新信息的同时保留历史上下文。
  • 在基于注意力的序列到序列模型中应用ACA机制,模型采用双向LSTM编码器和单向LSTM解码器。
  • 采用标准交叉熵损失端到端训练模型,ACA机制无缝集成于注意力计算中,无需对网络架构进行重大修改。

实验结果

研究问题

  • RQ1建模解码历史是否能提升神经机器翻译中注意力机制的性能?
  • RQ2将过去的解码器状态和注意力对齐信息纳入机制,是否能减少翻译中的重复现象?
  • RQ3一种同时考虑当前输入与先前输出的自适应注意力机制,是否能提升翻译的流畅性与准确性?
  • RQ4与标准注意力机制相比,所提出的ACA机制在长序列翻译任务中的表现如何?

主要发现

  • 在中文-英文翻译任务中,ACA模型相比最强基线模型提升3.61 BLEU点。
  • 在英文-越南文翻译任务中,模型相比最佳基线提升1.17 BLEU点。
  • 模型显著减少了重复短语的出现,例如在NIST 2003示例中,“the Russian capital of Moscow”不再多次重复。
  • 翻译示例显示,ACA生成的输出更准确、更连贯,能正确重组复杂结构,如人名和副词短语。
  • 模型在不同长度的序列上均保持稳定的性能提升,尤其在长句翻译中显著优于基线模型。
  • 消融实验表明,记忆向量与自适应控制机制对性能提升至关重要,移除后BLEU分数下降超过2分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。