Skip to main content
QUICK REVIEW

[论文解读] Evaluating Multimodal Representations on Sentence Similarity: vSTS, Visual Semantic Textual Similarity Dataset

Oier López de Lacalle, Aitor Soroa|arXiv (Cornell University)|Sep 11, 2018
Topic Modeling参考文献 18被引用 3
一句话总结

本文介绍了vSTS,一个结合句子对与人工标注相似度分数(0–5)及对应图像的多模态数据集,用于评估视觉增强的句子表示。通过结合仅文本模型(如可分解注意力模型)与图像表征(ResNet-50),研究发现视觉信息显著提升了句子相似度预测性能,在最佳文本与图像模型结合时,测试集的皮尔逊相关系数达到0.78。

ABSTRACT

In this paper we introduce vSTS, a new dataset for measuring textual similarity of sentences using multimodal information. The dataset is comprised by images along with its respectively textual captions. We describe the dataset both quantitatively and qualitatively, and claim that it is a valid gold standard for measuring automatic multimodal textual similarity systems. We also describe the initial experiments combining the multimodal information.

研究动机与目标

  • 创建一个标准化基准,用于评估视觉信息如何增强句子表示模型在语义相似度任务中的表现。
  • 探究仅使用图像表征是否能以合理精度预测句子相似度。
  • 检验结合图像与文本表征是否能提升相比仅使用文本模型的性能。

提出的方法

  • vSTS数据集源自STS基准的'STS-images'子集,包含829对句子,附带人工标注的相似度分数及对应图像。
  • 图像表征通过预训练的ResNet-50模型提取,而文本表征则通过词重叠、GloVe嵌入(质心平均)以及可分解注意力模型(DAM)生成。
  • 通过句子与图像嵌入之间的余弦相似度计算相似度分数。
  • 通过加法、乘法及线性回归测试模型组合,以融合文本与图像预测结果。
  • 数据集按50%的比例划分为开发集与测试集,相似度分数分布保持一致。
  • 线性回归参数通过在开发集上进行10折交叉验证进行调优。

实验结果

研究问题

  • RQ1仅使用图像表征能否以合理精度预测句子相似度?
  • RQ2与仅使用文本的模型相比,结合图像与文本表征是否能提升句子相似度任务的性能?
  • RQ3当引入视觉特征时,不同基于文本的模型(如词重叠、GloVe、DAM)表现如何?

主要发现

  • 仅使用图像的ResNet-50模型在测试集上达到0.61的皮尔逊相关系数,表明仅靠视觉表征即可携带有意义的相似度信息。
  • 在单一模型中,仅使用文本的可分解注意力模型(DAM)表现最佳,测试相关系数为0.69。
  • 通过线性回归将DAM与ResNet-50结合,取得最佳结果,测试皮尔逊相关系数达0.78。
  • 加法与乘法预测融合方法也提升了性能,最佳组合(DAM + ResNet-50)在所有融合方法中均达到0.78。
  • 该数据集对低相似度分数存在较强偏向(819个实例中有159个得分为0),但仍保持足够的可变性以支持有意义的评估。
  • 结果证实视觉与文本表征具有互补性,视觉输入可增强基于文本的推理,在多模态句子相似度任务中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。