Skip to main content
QUICK REVIEW

[论文解读] Doubly Attentive Transformer Machine Translation

Hasan Sait Arslan, Mark Fishel|arXiv (Cornell University)|Jul 30, 2018
Multimodal Machine Learning Applications参考文献 34被引用 17
一句话总结

本文提出了一种双注意力机制神经机器翻译模型(DATNMT),通过在改进的多头注意力层中联合关注源语言词汇与空间视觉特征,实现对双重视觉与语言模态的并行注意力建模。该模型在英德多模态翻译任务上达到最先进性能,相比先前方法BLEU4指标提升4.5分,并在使用大规模纯文本或图像字幕语料进行预训练时表现出显著优势。

ABSTRACT

In this paper a doubly attentive transformer machine translation model (DATNMT) is presented in which a doubly-attentive transformer decoder normally joins spatial visual features obtained via pretrained convolutional neural networks, conquering any gap between image captioning and translation. In this framework, the transformer decoder figures out how to take care of source-language words and parts of an image freely by methods for two separate attention components in an Enhanced Multi-Head Attention Layer of doubly attentive transformer, as it generates words in the target language. We find that the proposed model can effectively exploit not just the scarce multimodal machine translation data, but also large general-domain text-only machine translation corpora, or image-text image captioning corpora. The experimental results show that the proposed doubly-attentive transformer-decoder performs better than a single-decoder transformer model, and gives the state-of-the-art results in the English-German multimodal machine translation task.

研究动机与目标

  • 为解决单注意力机制在多模态神经机器翻译中的局限性,通过双注意力机制实现对源语言文本与视觉特征的独立、并行关注。
  • 通过利用图像-文本和纯文本预训练数据,在低资源多模态翻译设置中提升翻译质量。
  • 证明统一的Transformer解码器可在无需架构大幅调整的前提下,有效整合视觉与语言线索。
  • 探究在大规模纯文本或图像字幕数据集上进行预训练,是否能提升多模态翻译中的性能表现。

提出的方法

  • 提出一种增强型多头注意力层,包含两个独立的注意力向量:一个作用于源语言词元,另一个作用于图像的空间区域。
  • 利用预训练卷积神经网络(CNN)提取输入图像的空间视觉表征。
  • 将视觉与文本表征整合至单一Transformer解码器中,实现目标语言序列的自回归生成。
  • 采用两阶段训练策略:先在大规模纯文本(OPUS)和图像字幕(Flickr30k)数据集上进行预训练,再在目标多模态翻译任务上微调。
  • 对两种模态均采用标准的缩放点积注意力机制,为文本与视觉特征分别设置独立的查询、键和值矩阵。
  • 使用SoftAlignments工具可视化并分析源词、目标词与图像区域之间的注意力分布。

实验结果

研究问题

  • RQ1具备文本与图像特征双注意力头的Transformer解码器,是否能在多模态翻译中超越标准单注意力NMT模型?
  • RQ2在低资源多模态翻译中,基于大规模纯文本或图像字幕语料的预训练,能在多大程度上提升性能?
  • RQ3双注意力机制中的注意力权重是否能与源句中语义相关的部分及对应图像区域实现对齐?
  • RQ4视觉特征的引入是否能带来可测量的翻译质量提升,特别是在指代视觉对象方面?

主要发现

  • 在OPUS语料上预训练后,DATNMT在英德Multi30k测试集上达到42.2的BLEU4分数,比基线TNMT高出4.2 BLEU点。
  • 在无预训练条件下,DATNMT仍取得41.0的BLEU4分数,较标准TNMT(38.6 BLEU4)提升2.4分,证明双注意力机制的有效性。
  • 在Flickr30k上预训练使TNMT提升2.7 BLEU点(从38.6增至39.6),而DATNMT的增益较小(从41.0增至41.1),表明DATNMT已从领域内数据中获益。
  • DATNMT在以精确率为导向的指标(BLEU4)上表现更优,而NMT(SRC+IMG)在以召回率为导向的指标(METEOR、TER)上更优,表明二者具有互补优势。
  • 注意力图可视化结果表明,模型能将目标词如“Teenager”和“Trompete”与头部区域对应图像区域实现对齐,证实了语义层面的注意力对齐。
  • 该模型能有效利用领域内图像字幕数据(Flickr30k)与领域外纯文本语料(OPUS),展现出跨数据类型的稳健泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。