[论文解读] Imagination improves Multimodal Translation
本文提出 Imagination,一种多任务模型,通过共享编码器学习翻译和视觉对齐表示,在翻译阶段不使用图像输入即可获得 Multi30K 的最新结果。外部数据(描述图像和并行文本)还可以进一步提升性能。
We decompose multimodal translation into two sub-tasks: learning to translate and learning visually grounded representations. In a multitask learning framework, translations are learned in an attention-based encoder-decoder, and grounded representations are learned through image representation prediction. Our approach improves translation performance compared to the state of the art on the Multi30K dataset. Furthermore, it is equally effective if we train the image prediction task on the external MS COCO dataset, and we find improvements if we train the translation model on the external News Commentary parallel text.
研究动机与目标
- 通过利用可视化对齐表征来推动并提升多模态翻译。
- 将多模态翻译分解为翻译学习和视觉对位任务。
- 证明共享编码器可以在外部并行文本或描述图像数据上进行训练。
- 展示在翻译时不使用图像的情况下,在 Multi30K 上实现最先进的结果。
- 说明对域外数据的鲁棒性,并描述有助于性能提升的资源。
提出的方法
- 提出一个多任务模型(Imagination),具有一个共享编码器,将翻译解码器和 Imaginet 图像预测解码器都作为输入。
- 通过基于注意力的神经机器翻译模型进行翻译训练。
- 训练一个辅助的图像预测解码器,利用共享编码器表示来预测全局图像特征向量。
- 使用联合目标 J(θ,φ)=w J_T(θ,φ^t)+(1−w) J_G(θ,φ^g)来结合任务,并允许在不同数据集(D_image、D_text)上进行训练。
- 在域内数据(Multi30K)和域外数据(MS COCO、News Commentary)上进行评估,并使用集成解码。
实验结果
研究问题
- RQ1在翻译阶段不使用图像时,具有多任务学习的共享编码器是否能够提升多模态翻译?
- RQ2辅助的图像预测是否促使地面化的源表示从而提高翻译质量?
- RQ3在使用外部数据进行图像对位的训练、以及使用外部并行文本进行翻译训练时,性能是否鲁棒?
- RQ4在多任务设置中,域外资源(COCO、News Commentary)对翻译质量有何影响?
- RQ5跨域训练模型的集成是否能在 Multi30K 上达到最先进的结果?
主要发现
- Imagination 模型在 En→De Multi30K 上的域内单模型达到 55.8 Meteor 和 36.8 BLEU,在域内多模型集成达到 57.6 Meteor。
- 结合域外 COCO 描述图像进行图像预测时,Imagination 仍具竞争力(55.6 Meteor,36.4 BLEU)。
- 结合 News Commentary 并行文本可提升,在与 COCO 和 Multi30K 数据的集成中达到 59.3 Meteor。
- 在域内数据加上外部资源训练的模型,集成后达到 59.3 Meteor 的新最优值。
- 使用分离的 D_text 和 D_image 数据进行训练不会降低性能;即使翻译数据来自外部,图像预测也带来收益。
- 使用子词词汇表和数据组合(Multi30K + NC)可带来显著提升(如最佳集成为 59.3 Meteor)。
- Imaginet 解码器的对位目标提升了图像检索对齐度(中位数排位约 11),表明对位表示得到强化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。