Skip to main content
QUICK REVIEW

[论文解读] Crisscrossed Captions: Extended Intramodal and Intermodal Semantic Similarity Judgments for MS-COCO

Zarana Parekh, Jason Baldridge|arXiv (Cornell University)|Apr 30, 2020
Multimodal Machine Learning Applications参考文献 31被引用 14
一句话总结

Crisscrossed Captions (CxC) 在 MS-COCO 的基础上增加了 267,095 个由人类标注的语义相似度判断,涵盖图像-标题、标题-标题和图像-图像配对,支持对多模态和单模态表征学习的全面评估。在图像-文本和标题-标题配对上联合训练的多任务双编码器模型在四项检索任务中均达到最先进性能,并表明跨模态学习能提升文本编码效果,但以牺牲图像编码为代价,这种权衡唯有通过 CxC 的密集标注才能测量。

ABSTRACT

By supporting multi-modal retrieval training and evaluation, image captioning datasets have spurred remarkable progress on representation learning. Unfortunately, datasets have limited cross-modal associations: images are not paired with other images, captions are only paired with other captions of the same image, there are no negative associations and there are missing positive cross-modal associations. This undermines research into how inter-modality learning impacts intra-modality tasks. We address this gap with Crisscrossed Captions (CxC), an extension of the MS-COCO dataset with human semantic similarity judgments for 267,095 intra- and inter-modality pairs. We report baseline results on CxC for strong existing unimodal and multimodal models. We also evaluate a multitask dual encoder trained on both image-caption and caption-caption pairs that crucially demonstrates CxC's value for measuring the influence of intra- and inter-modality learning.

研究动机与目标

  • 为解决现有图像字幕数据集(如 MS-COCO)中缺乏全面的跨模态与模内关系的问题。
  • 通过包含跨模态的正负关联,实现对多模态表征学习的全面评估。
  • 支持学习跨模态(图像-文本)和模内(文本-文本、图像-图像)关系的模型的开发与评估。
  • 提供统一基准,用于评估模型在图像-文本、文本-图像、文本-文本和图像-图像检索任务中的性能。
  • 验证多任务学习在平衡多样化检索与相似度任务性能方面的实用性。

提出的方法

  • 使用受语义文本相似度(STS)启发的分级相似度量表(0–5分),对 267,095 个图像-标题、标题-标题和图像-图像配对进行语义相似度评分标注。
  • 采用间接采样策略,偏向多样化相似度分布,以确保语义相关性的广泛覆盖。
  • 训练一个具有双向损失的多任务双编码器模型,用于图像-文本检索,并为文本-文本检索设置独立损失。
  • 使用基于 BERT 的文本编码器和 EfficientNet-B4 作为图像编码器,联合优化图像-文本和标题-标题相似度。
  • 通过公开发布的代码,将 CxC 标注与现有的 MS-COCO 数据合并,实现与现有基准的无缝集成。
  • 使用召回率@k、斯皮尔曼等级相关系数(Spearman R)以及四项不同任务的检索性能对模型进行评估。

实验结果

研究问题

  • RQ1在图像-标题和标题-标题配对上联合学习,如何影响图像-文本、文本-图像、文本-文本和图像-图像检索任务的性能?
  • RQ2现有单模态与多模态模型在标准 MS-COCO 评估中未包含的模内相似度判断上,其泛化能力如何?
  • RQ3当在一个统一且密集的跨模态与模内配对集合上进行训练时,单一模型架构能否在多样化检索与相似度任务中实现平衡性能?
  • RQ4当模型被训练以同时优化跨模态与模内相似度时,其表征能力会面临何种权衡?
  • RQ5人类标注的相似度评分与不同模态和任务中模型预测的相关性如何?

主要发现

  • 多任务双编码器(DE T2T+I2T)在所有四项检索任务中均取得最强整体性能,优于仅在图像-标题配对上训练的模型。
  • DE T2T+I2T 模型在多个模型中实现了召回率@k 提升 1–3% 的绝对增长,表明 CxC 的额外正样本对提升检索召回率具有显著帮助。
  • 尽管仅在图像-标题配对上进行训练,DE T2T+I2T 模型在文本-文本相似度任务中取得了最高的斯皮尔曼相关系数(Spearman R = 0.82),并在所有三项相似度任务(STS、SIS、SITS)中表现出均衡性能。
  • 仅在图像-标题配对上训练的模型(DE I2T)在 SIS 任务中得分最高(81.3),但 STS 任务得分最低(50.9),表明其对图像表征的过度关注以牺牲文本表征为代价。
  • CxC 标注揭示,共用标题(同一图像的多个标题)的平均相似度仅为 3.0,挑战了其在文本改写生成中的适用性,并凸显了在人类评估中引入图像上下文的重要性。
  • 与 MS-COCO 原始的 50,000 个二元配对相比,CxC 数据集的标注密度提高了 5 倍以上,其 267,095 个相似度评分基于 1,335,475 个独立的人工判断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。