Skip to main content
QUICK REVIEW

[论文解读] Gumbel-Attention for Multi-modal Machine Translation

Pengbo Liu, Hailong Cao|arXiv (Cornell University)|Mar 16, 2021
Natural Language Processing Techniques参考文献 20被引用 17
一句话总结

本文提出Gumbel-Attention,一种基于Gumbel-Sigmoid的可微机制,可选择性地关注多模态机器翻译中的文本相关视觉特征,从而减少无关图像区域带来的噪声。实验表明,该方法在三个基准数据集上实现了最先进或接近最先进性能,在BLEU分数上相比仅使用文本的Transformer模型提升了超过1.5分。

ABSTRACT

Multi-modal machine translation (MMT) improves translation quality by introducing visual information. However, the existing MMT model ignores the problem that the image will bring information irrelevant to the text, causing much noise to the model and affecting the translation quality. This paper proposes a novel Gumbel-Attention for multi-modal machine translation, which selects the text-related parts of the image features. Specifically, different from the previous attention-based method, we first use a differentiable method to select the image information and automatically remove the useless parts of the image features. Experiments prove that our method retains the image features related to the text, and the remaining parts help the MMT model generates better translations.

研究动机与目标

  • 为解决多模态机器翻译中无关视觉噪声导致翻译质量下降的问题。
  • 开发一种可微的、端到端可训练的方法,自动过滤与源文本无关的图像区域。
  • 通过可学习的选择机制,使模型聚焦于语义相关的视觉内容,从而提升翻译性能。
  • 引入一种多模态相似性损失,对齐视觉与文本表示,进一步增强特征的相关性。

提出的方法

  • Gumbel-Attention机制利用Gumbel-Sigmoid采样,从图像特征中可微地选择相关空间区域,支持基于梯度的优化。
  • Gumbel-Sigmoid通过加入Gumbel噪声的随机采样近似离散选择,使梯度能够反向传播通过选择过程。
  • 该方法用可学习的稀疏注意力掩码替代标准注意力机制,在跨注意力计算过程中抑制无关的图像特征。
  • 引入一种多模态相似性损失,对齐图像感知的文本特征与原始文本嵌入的表示,促进语义一致性。
  • 将这些组件整合到基于Transformer的编码器-解码器框架中,在保持架构简洁的同时提升性能。
  • 采用交叉熵损失与所提出的多模态相似性损失相结合的方式,端到端训练该方法。

实验结果

研究问题

  • RQ1一种可微的、可学习的注意力机制能否有效过滤多模态翻译中的无关视觉特征?
  • RQ2在翻译质量方面,Gumbel-Attention与标准注意力机制和随机图像基线相比表现如何?
  • RQ3多模态相似性损失在多大程度上改善了视觉与文本表示之间的对齐?
  • RQ4所提出的方法是否在保持低模型复杂度的同时,维持性能提升并实现易于复现?
  • RQ5Gumbel-Attention机制是否具有泛化能力,可应用于其他多模态学习场景?

主要发现

  • 在Multi30k Test2016数据集上,Gumbel-Attention模型取得了39.2的BLEU分数和57.8的METEOR分数,相比仅使用文本的Transformer模型,BLEU分数提升了超过1.5分。
  • 将Gumbel-Attention替换为普通注意力机制会使性能下降超过1 BLEU分,证明了视觉噪声的负面影响。
  • 即使使用随机图像作为输入,其性能仍优于仅使用文本的基线模型,表明图像输入起到了正则化作用。
  • 消融实验证明,多模态门控融合与相似性损失均有效,其中后者虽影响较小但具有明显作用。
  • 即使在文本和图像感知编码器之间共享参数的情况下,模型仍保持优异性能,表明其高效性与鲁棒性。
  • 该方法在所有三个基准数据集上均取得了最先进或接近最先进结果,证实了其有效性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。