[论文解读] Exposing and Mitigating Spurious Correlations for Cross-Modal Retrieval
本文提出 ODmAP@k,一种新型度量指标,用于衡量并缓解图像-文本检索模型中因训练数据中语义无关对象频繁共现而引发的虚假相关性。通过在合成生成的数据上进行微调——采用图像修复(inpainting)移除物体及文本重述——该方法在不损害标准检索性能的前提下,显著提升了模型对虚假相关性的鲁棒性,该结论在 MSCOCO 和 Flickr30k 数据集上的三款 SOTA 模型中均得到验证。
Cross-modal retrieval methods are the preferred tool to search databases for the text that best matches a query image and vice versa. However, image-text retrieval models commonly learn to memorize spurious correlations in the training data, such as frequent object co-occurrence, instead of looking at the actual underlying reasons for the prediction in the image. For image-text retrieval, this manifests in retrieved sentences that mention objects that are not present in the query image. In this work, we introduce ODmAP@k, an object decorrelation metric that measures a model's robustness to spurious correlations in the training data. We use automatic image and text manipulations to control the presence of such object correlations in designated test data. Additionally, our data synthesis technique is used to tackle model biases due to spurious correlations of semantically unrelated objects in the training data. We apply our proposed pipeline, which involves the finetuning of image-text retrieval frameworks on carefully designed synthetic data, to three state-of-the-art models for image-text retrieval. This results in significant improvements for all three models, both in terms of the standard retrieval performance and in terms of our object decorrelation metric. The code is available at https://github.com/ExplainableML/Spurious_CM_Retrieval.
研究动机与目标
- 识别并量化虚假相关性(如语义无关对象的频繁共现)对图像-文本检索模型的影响。
- 开发一种新评估指标 ODmAP@k,通过在移除物体的图像上测试检索性能,衡量模型对这类虚假相关性的鲁棒性。
- 设计一种数据增强流水线,生成合成图像-文本对,通过消除训练数据中频繁共现的物体来实现模型去偏。
- 证明在合成数据上进行微调可提升模型在新指标上的鲁棒性,同时保持或提升标准检索性能。
提出的方法
- 提出 ODmAP@k 指标,用于评估检索到的文本是否包含查询图像中存在的物体,并排除从原始图像中被移除的物体。
- 利用目标检测与图像修复技术,通过从真实图像中移除频繁共现的物体,生成合成查询图像。
- 通过名词短语移除或文本生成模型生成相应文本描述,构建配对的合成图像-文本数据。
- 采用结合原始数据与合成数据的微调流水线,对图像-文本检索模型进行去偏。
- 比较多种图像生成策略(如模糊、零填充、平均填充、修复)与文本生成方法(如提示词、图像字幕模型)的有效性。
- 在三款 SOTA 图像-文本检索模型(如 CLIP)上进行训练与评估,使用标准基准(MSCOCO、Flickr30k)及新指标。
实验结果
研究问题
- RQ1现有图像-文本检索模型在多大程度上依赖于虚假相关性(如语义无关对象的频繁共现),而非真实图像内容?
- RQ2如何设计一种度量指标,专门量化模型在检索任务中对这类虚假相关性的鲁棒性?
- RQ3何种合成数据生成策略(图像与文本)最有效地减少对虚假物体共现的记忆?
- RQ4在合成数据上进行微调是否能提升模型在新指标上的鲁棒性,同时不降低标准检索性能?
主要发现
- 当使用基于名词短语移除与图像修复生成的合成数据对 CLIP 模型进行微调后,ODmAP@1 从 59.8 提升至 70.1,表明虚假相关性得到显著缓解。
- 表现最佳的合成数据生成方法为:文本使用名词短语移除,图像使用图像修复,实现 70.1 的 ODmAP@1;而基于提示词的文本生成则引发聚类问题(hubness problem),在较高 k 值下性能下降。
- 使用约 10% 的合成数据(相当于每张图像一个字幕)即足以实现 ODmAP@1 的近最大提升,进一步增加合成数据比例在 20% 以上时趋于饱和。
- 标准检索性能(R@1)在不同合成数据比例下保持稳定,表明主任务性能未受损。
- 该方法在三款 SOTA 模型上均显著提升了鲁棒性,证明其具有超越单一架构的泛化能力。
- 使用分布外图像方法(如零填充)生成的合成数据导致性能更差,表明分布偏移可能引入新的偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。