[论文解读] Webly Supervised Joint Embedding for Cross-Modal Image-Text Retrieval
本文提出一种两阶段的网页弱监督方法,通过联合训练少量完全标注的图像-文本对与大量带有噪声标签的网页图像,提升了跨模态图像-文本检索性能。通过将弱标注的网页数据整合到监督成对排序损失(如 VSE 或 VSEPP)中,该方法学习到更鲁棒的视觉-语义嵌入,相比当前最先进方法,在 MSCOCO 和 Flickr30K 数据集上 R@10 的性能提升最高达 9%。
Cross-modal retrieval between visual data and natural language description remains a long-standing challenge in multimedia. While recent image-text retrieval methods offer great promise by learning deep representations aligned across modalities, most of these methods are plagued by the issue of training with small-scale datasets covering a limited number of images with ground-truth sentences. Moreover, it is extremely expensive to create a larger dataset by annotating millions of images with sentences and may lead to a biased model. Inspired by the recent success of webly supervised learning in deep neural networks, we capitalize on readily-available web images with noisy annotations to learn robust image-text joint representation. Specifically, our main idea is to leverage web images and corresponding tags, along with fully annotated datasets, in training for learning the visual-semantic joint embedding. We propose a two-stage approach for the task that can augment a typical supervised pair-wise ranking loss based formulation with weakly-annotated web images to learn a more robust visual-semantic embedding. Experiments on two standard benchmark datasets demonstrate that our method achieves a significant performance gain in image-text retrieval compared to state-of-the-art approaches.
研究动机与目标
- 解决在监督图像-文本检索中使用的小型完全标注图像-文本数据集所面临的可扩展性与偏差限制问题。
- 探究大规模、弱标注的网页图像(带有噪声标签)是否能提升视觉-语义嵌入的鲁棒性。
- 开发一种实用且可扩展的框架,将弱监督的网页数据与监督的图像-文本对相结合,以提升检索性能。
- 在减少对昂贵人工标注数据集依赖的同时,提升图像-文本检索在跨数据集场景下的泛化能力。
提出的方法
- 提出一种两阶段训练框架:首先在少量完全标注的图像-文本对上使用标准成对排序损失(如 VSE 或 VSEPP)对联合嵌入模型进行预训练。
- 在第二阶段,通过联合优化监督损失与弱监督损失,对模型进行微调,使用带有噪声标签的网页图像。
- 将标签作为弱监督信号,通过构建图像特征与标签嵌入之间的对比损失对,其中标签通过 TF-IDF 加权的词袋(BOW)向量表示。
- 采用共享嵌入空间,将图像和文本特征映射到同一潜在空间,以支持跨模态相似度计算。
- 通过加权组合排序损失的方式,整合监督与弱监督信号,使模型能够在不降低性能的前提下从噪声网页数据中学习。
- 采用深度神经网络(如 ResNet152、VGG19)进行图像特征提取,使用基于 RNN 的编码器与 Word2Vec 进行句子编码。
实验结果
研究问题
- RQ1大规模、弱标注的网页图像(带有噪声标签)是否能提升图像-文本检索中视觉-语义嵌入的鲁棒性?
- RQ2将网页数据与有限的人工标注图像对结合,对 MSCOCO 和 Flickr30K 等标准基准测试的性能有何影响?
- RQ3与纯监督基线相比,所提出方法在跨数据集场景下的泛化能力是否更优?
- RQ4不同损失函数(VSE 与 VSEPP)以及不同图像特征提取器(VGG19 与 ResNet152)如何与网页弱监督训练方案相互作用?
主要发现
- 在 MSCOCO 数据集上,所提方法在 VSEPP-VGG19 变体中,R@1 提升 6%,R@10 最高提升 9%,相比标准监督基线。
- 在 Flickr30K 数据集上,图像到文本检索中 R@1 提升 3–6%,R@10 提升 3–9%,其中 VSEPP-VGG19 配置下增益最大。
- 在文本到图像检索中,所有配置下的 R@1 平均提升 2.25%,R@10 平均提升 3.25%,表明在两个检索方向上均保持一致的性能增益。
- 当使用 ResNet152 特征时,性能提升更为显著:文本到图像检索中 R@1 提升达 11.18%,而 VGG19 仅为 3.5%。
- 该方法在 VSE 与 VSEPP 两种损失形式下均持续提升性能,表明其与不同排序损失设计具有良好的兼容性。
- 该方法对特征选择和损失函数均具有鲁棒性,表明网页数据的引入能有效提升泛化能力,无论底层架构或损失函数如何。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。