Skip to main content
QUICK REVIEW

[论文解读] Better Text Understanding Through Image-To-Text Transfer

Karol Kurach, Sylvain Gelly|arXiv (Cornell University)|May 23, 2017
Multimodal Machine Learning Applications参考文献 23被引用 7
一句话总结

本文提出视觉增强文本嵌入(VETE),一种简单而有效的模型,通过直接将句子级文本表示与预训练卷积神经网络(CNN)生成的图像嵌入对齐,从而提升其性能。通过端到端训练句子嵌入以匹配对应图像特征,并使用皮尔逊相关性损失进行优化,VETE在SemEval文本相似度基准测试中优于以往的多模态与纯文本方法,在图像相关数据集上取得了最先进(SOTA)的结果,且所需训练数据显著更少。

ABSTRACT

Generic text embeddings are successfully used in a variety of tasks. However, they are often learnt by capturing the co-occurrence structure from pure text corpora, resulting in limitations of their ability to generalize. In this paper, we explore models that incorporate visual information into the text representation. Based on comprehensive ablation studies, we propose a conceptually simple, yet well performing architecture. It outperforms previous multimodal approaches on a set of well established benchmarks. We also improve the state-of-the-art results for image-related text datasets, using orders of magnitude less data.

研究动机与目标

  • 通过引入图像-文本对中的视觉信号,改进通用文本嵌入。
  • 探究直接优化句子嵌入(而非词嵌入)是否能带来更好的迁移性能。
  • 评估不同模型架构、损失函数和训练数据集在多模态设置下对文本嵌入质量的影响。
  • 确定简单文本编码器(如词袋模型BOW)是否能在多模态迁移学习中超越复杂模型(如LSTM)

提出的方法

  • 模型使用预训练的CNN提取图像嵌入,并将其作为句子嵌入训练的目标。
  • 句子嵌入由词嵌入的L2归一化和构成,文本编码器采用端到端方式进行训练。
  • 模型优化预测的句子-图像相似度与真实相似度得分之间的皮尔逊相关性。
  • 评估了多种损失函数,包括协方差、皮尔逊相关性、代理肯德尔等级相关(surrogate Kendall tau)和成对排序损失。
  • 比较了在词级别(事后组合词嵌入)与句子级别(联合优化完整句子表示)进行训练的方法。
  • 模型在多个数据集上进行训练与评估:MS COCO、SBU和Pinterest5M,性能在SemEval基准上进行衡量。

实验结果

研究问题

  • RQ1是否可以通过将句子嵌入直接对齐到图像表示,来提升纯文本预训练之外的一般文本理解能力?
  • RQ2使用视觉监督进行句子嵌入的端到端训练,是否优于先学习词嵌入再组合的方法?
  • RQ3不同文本编码器(如BOW与RNN)和损失函数如何影响多模态句子嵌入的质量?
  • RQ4是否可以通过极简的模型架构,在远少于先前SOTA方法所需训练数据的情况下,实现文本相似度任务的最先进性能?

主要发现

  • VETE-BOW在SemEval基准上取得了0.797的皮尔逊相关性,优于以往的多模态模型,并在图像相关数据集上达到最先进水平。
  • 在Pinterest5M数据集上,VETE-BOW在四个评估集上的平均得分为0.803,显著优于所有基线模型。
  • 句子级别训练在images2014数据集上取得了0.861的性能,显著优于词级别训练的0.576,表明联合优化能更好地捕捉共现与互补语义。
  • 尽管结构简单,基于BOW的VETE模型仍优于更复杂的RNN模型,表明在多模态迁移学习中,架构复杂性并不总能提升性能。
  • 该模型在图像相关文本相似度任务中取得了最先进性能,且训练数据量仅为先前SOTA方法的数个数量级。
  • 代理肯德尔等级相关(SKT)损失表现出色,表明基于排序的相关性可作为多模态学习中皮尔逊相关性的有效替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。