Skip to main content
QUICK REVIEW

[论文解读] Mapping Images to Sentiment Adjective Noun Pairs with Factorized Neural Nets

Takuya Narihira, Damian Borth|arXiv (Cornell University)|Nov 21, 2015
Multimodal Machine Learning Applications参考文献 27被引用 10
一句话总结

该论文提出了一种因子化卷积神经网络(Fact-Net),在将形容词和名词的视觉表征分别学习后,再将其组合为情感形容词-名词对(ANPs),从而实现对未见ANPs的鲁棒泛化,并在噪声较多的网络标注数据上表现更优。该模型在零样本ANP检索任务中优于标准ANP分类器和图像字幕生成模型,并通过学习到的语义关联关系扩展了ANP词汇表。

ABSTRACT

We consider the visual sentiment task of mapping an image to an adjective noun pair (ANP) such as "cute baby". To capture the two-factor structure of our ANP semantics as well as to overcome annotation noise and ambiguity, we propose a novel factorized CNN model which learns separate representations for adjectives and nouns but optimizes the classification performance over their product. Our experiments on the publicly available SentiBank dataset show that our model significantly outperforms not only independent ANP classifiers on unseen ANPs and on retrieving images of novel ANPs, but also image captioning models which capture word semantics from co-occurrence of natural text; the latter turn out to be surprisingly poor at capturing the sentiment evoked by pure visual experience. That is, our factorized ANP CNN not only trains better from noisy labels, generalizes better to new images, but can also expands the ANP vocabulary on its own.

研究动机与目标

  • 解决使用噪声较多的网络来源标注,将图像映射到情感形容词-名词对(ANPs)如'adorable baby'的挑战。
  • 克服标准ANP分类器在泛化至未见ANPs或处理语义模糊性与标注噪声方面的局限性。
  • 开发一种模型,学习形容词和名词的结构化、解耦表征,同时优化整体ANP分类性能。
  • 通过利用形容词与名词之间的语义关联,实现对新型ANPs的零样本泛化。
  • 在性能上超越图像字幕生成模型,后者尽管学习了自然语言共现模式,但未能有效捕捉视觉情感。

提出的方法

  • 该模型采用因子化CNN架构,通过两个独立的子网络分别学习形容词(A)和名词(N)的深层特征。
  • 最终的ANP预测通过A和N子网络的潜在表征的乘积计算得出,形成双线性交互,以建模联合语义空间。
  • 模型通过端到端训练,采用ANP分类任务的softmax交叉熵损失进行优化,目标是完整ANP输出而非单个组件。
  • 该架构设计为具有判别性和非线性特性,与用于特征提取或生成建模的双线性CNN有本质区别。
  • 在SentiBank数据集上评估模型,使用检索和分类指标比较在已见和未见ANPs上的性能。
  • 该方法可通过检索语义相似图像实现共识重标注和词汇表扩展,即使标签存在错误或模糊。

实验结果

研究问题

  • RQ1在使用噪声较多的网络来源图像标注进行训练时,因子化深度学习模型能否泛化至未见的形容词-名词对(ANPs)?
  • RQ2在零样本ANP检索中,因子化ANP分类器的性能与标准ANP分类器和图像字幕生成模型相比如何?
  • RQ3形容词与名词之间的语义关联在多大程度上提升了视觉情感分析中的泛化能力和抗噪声能力?
  • RQ4当用户标签错误或模糊时,该模型能否有效检索训练数据中不存在的ANPs对应的图像?
  • RQ5该模型的泛化能力是否更多依赖于语义结构而非训练数据量?

主要发现

  • Fact-Net在未见ANPs上的表现显著优于标准ANP-net基线模型,top-10准确率差距最高达0.4,表明其具备强大的零样本泛化能力。
  • 在未见ANPs上,Fact-Net的检索质量明显优于Fork-Net,检索结果在名词对齐上更准确,且检索图像中的形容词种类更丰富。
  • 即使用户标签错误,Fact-Net仍能正确检索'ugly baby'和'ugly sky'等ANPs对应的图像,表明其对标注噪声具有强鲁棒性。
  • 对于'beautiful men'这一ANP,Fact-Net即使在用户标签为'hot girls'或'cold beer'的情况下,仍能检索到语义一致的图像,展现出有效的共识重标注能力。
  • Fact-Net的性能提升不能归因于训练数据量,因为准确率与数据暴露量之间的皮尔逊相关系数低至0.05,表明泛化能力源于学习到的语义结构。
  • 尽管图像字幕生成模型学习了自然语言共现模式,但在视觉情感任务上表现不佳,凸显了专用ANP建模的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。