Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Multimodal Neural Machine Translation with Pseudo Visual Pivoting

Po-Yao Huang, Junjie Hu|arXiv (Cornell University)|May 6, 2020
Multimodal Machine Learning Applications参考文献 46被引用 5
一句话总结

本文提出了一种新颖的无监督多模态神经机器翻译框架,利用视觉内容作为伪中间语,以改善潜在空间中的跨语言对齐。通过学习共享的多语言视觉-语义嵌入空间,并基于真实图像生成两种语言的伪字幕句子,该模型在 Multi30K 数据集上实现了最先进性能,且在推理阶段无图像输入时仍具有良好的泛化能力。

ABSTRACT

Unsupervised machine translation (MT) has recently achieved impressive results with monolingual corpora only. However, it is still challenging to associate source-target sentences in the latent space. As people speak different languages biologically share similar visual systems, the potential of achieving better alignment through visual content is promising yet under-explored in unsupervised multimodal MT (MMT). In this paper, we investigate how to utilize visual content for disambiguation and promoting latent space alignment in unsupervised MMT. Our model employs multimodal back-translation and features pseudo visual pivoting in which we learn a shared multilingual visual-semantic embedding space and incorporate visually-pivoted captioning as additional weak supervision. The experimental results on the widely used Multi30K dataset show that the proposed model significantly improves over the state-of-the-art methods and generalizes well when the images are not available at the testing time.

研究动机与目标

  • 解决在无监督神经机器翻译(NMT)中因缺乏共享参考而导致的跨语言句子对齐不佳的问题,利用视觉内容作为共享参考。
  • 通过利用生物基础的、与语言无关的视觉感知作为对齐信号,克服第三语言中间语方法的局限性。
  • 通过使用跨语言的不相交图像-句子对学习共享的多语言视觉-语义嵌入空间,提升无监督 MMT 性能。
  • 通过在两种语言中生成图像引导的合成字幕,构建弱监督信号,实现在无平行数据下的反向翻译。
  • 在 Multi30K 上实现最先进结果,同时在仅文本推理场景中保持强大泛化能力。

提出的方法

  • 利用视觉内容作为伪中间语,在共享视觉-语义嵌入空间中对齐多语言句子表示。
  • 使用对比损失在来自不同语言的不相交图像-句子对上训练多语言视觉-语义嵌入(VSE)模型。
  • 基于真实图像在源语言和目标语言中合成伪字幕,为反向翻译提供弱监督。
  • 为翻译和字幕生成模块均采用 Transformer 架构,支持端到端的多模态反向翻译训练。
  • 采用两阶段训练流程:首先预训练单语语言模型和 VSE,然后联合优化翻译和字幕生成,并引入重建目标。
  • 引入目标检测特征以丰富视觉表征,提升图像区域与对应句子词元之间的对齐质量。

实验结果

研究问题

  • RQ1视觉内容能否作为有效的、与语言无关的中间语,改善无监督多模态 NMT 中的跨语言对齐?
  • RQ2如何利用跨语言的不相交图像-句子对来学习共享的多语言视觉-语义嵌入空间?
  • RQ3在无平行数据的情况下,能否通过在两种语言中生成图像条件化的合成字幕,为无监督 NMT 提供有效的弱监督?
  • RQ4所提出的伪视觉中间语方法是否能在测试时无图像输入的纯文本推理设置中实现良好泛化?
  • RQ5在 BLEU 和 METEOR 分数上,该模型相较于现有无监督 MMT 方法的性能提升程度如何?

主要发现

  • 所提模型在英法翻译任务上达到 BLEU 65.5 和 METEOR 79.1,显著优于 Multi30K 上的先前最先进方法。
  • 在英德翻译任务上,模型取得 BLEU 42.3 和 METEOR 60.6 的成绩,展现出在多种语言对上的强劲性能。
  • 模型在仅文本推理设置中表现出良好泛化能力,即使在测试时无图像输入,仍保持高性能。
  • 消融实验证实,共享的多语言 VSE 空间和伪字幕生成组件均对性能提升有显著贡献。
  • 与全局图像嵌入相比,使用基于目标的视觉特征可提升对齐质量,如跨语言句子匹配性能所显示。
  • 该模型优于现有无监督 MMT 方法(如 Game-MMT 和 UMMT),尤其在低资源和零样本设置下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。