Skip to main content
QUICK REVIEW

[论文解读] Doubly-Attentive Decoder for Multi-modal Neural Machine Translation

Iacer Calixto, Qun Liu|arXiv (Cornell University)|Feb 4, 2017
Natural Language Processing Techniques参考文献 26被引用 6
一句话总结

本文提出了一种用于多模态神经机器翻译的双重注意力解码器,该解码器使用两种独立的注意力机制,分别关注源语言词汇和空间视觉特征。该模型通过在解码过程中有效融合视觉与文本信息,在 Multi30k 数据集上取得了最先进(SOTA)的结果,优于仅使用文本或先前的多模态 NMT 模型。

ABSTRACT

We introduce a Multi-modal Neural Machine Translation model in which a doubly-attentive decoder naturally incorporates spatial visual features obtained using pre-trained convolutional neural networks, bridging the gap between image description and translation. Our decoder learns to attend to source-language words and parts of an image independently by means of two separate attention mechanisms as it generates words in the target language. We find that our model can efficiently exploit not just back-translated in-domain multi-modal data but also large general-domain text-only MT corpora. We also report state-of-the-art results on the Multi30k data set.

研究动机与目标

  • 为解决先前多模态 NMT 模型在使用空间视觉特征时效果有限的问题,这些模型通常无法超越仅使用文本或全局视觉特征的模型。
  • 设计一种联合的、端到端可训练的解码器,在目标序列生成过程中,分别对源词和空间图像区域应用两种独立的注意力机制。
  • 探究将领域内多模态数据与大规模纯文本 NMT 语料相结合,是否能提升多模态翻译任务中的模型泛化能力与性能。
  • 证明当通过双重注意力机制恰当整合后,空间视觉特征可显著提升图像条件翻译任务中的翻译质量。

提出的方法

  • 该模型采用双向 GRU 编码器,从输入句子生成上下文相关的源句表示。
  • 双重注意力解码器使用两种不同的注意力机制:一种作用于源词注释,另一种作用于通过预训练 CNN(如 VGG19)从图像中提取的空间视觉特征。
  • 解码器的隐藏状态同时依赖于来自源词的上下文向量和来自图像区域的上下文向量,这两个向量由独立的注意力网络计算得出。
  • 最终输出分布通过软注意力机制计算,将解码器的隐藏状态与两个上下文向量通过学习得到的变换矩阵进行融合。
  • 整个模型使用交叉熵损失进行端到端训练,注意力权重根据目标词与源模态之间的对齐情况,在每个解码步骤动态更新。
  • 该模型首先在中等规模、经反向翻译的领域内多模态数据集上进行预训练,随后在大规模通用领域纯文本 NMT 语料上进行微调。

实验结果

研究问题

  • RQ1是否可以通过分别关注源词和图像区域的双重注意力机制,使多模态神经机器翻译性能超越仅使用全局视觉特征或仅使用文本输入的模型?
  • RQ2通过独立注意力机制整合空间视觉特征,是否能在图像条件翻译基准上带来可测量的翻译质量提升?
  • RQ3在领域内多模态数据上预训练并进一步在大规模纯文本 NMT 语料上微调的模型,是否能有效利用两类数据以提升性能?
  • RQ4当在相同数据上进行训练时,该模型与强大的纯文本 NMT 及短语基于 SMT 基线模型相比表现如何?

主要发现

  • 所提出的双重注意力解码器在 Multi30k 测试集上达到了最先进性能,优于先前的多模态 NMT 模型。
  • 该模型相较于强大的纯文本 NMT 基线模型表现出显著改进,证实了当适当地关注时,空间视觉特征能提供有意义的信息。
  • 该模型有效利用了领域内多模态数据和大规模通用领域纯文本 NMT 语料,在不同领域间展现出强大的泛化能力。
  • 对词汇和图像区域分别使用独立注意力机制,带来了更好的对齐效果和更准确的翻译,尤其在涉及特定视觉对象的描述中表现更优。
  • 该模型在性能上优于先前使用全局图像特征或未能显著超越纯文本模型的多模态 NMT 方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。