[论文解读] Image Retrieval on Real-life Images with Pre-trained Vision-and-Language Models
本文提出了CIRR,一个包含36,000个真实生活场景下图像-文本对的大规模开放域数据集,用于组合图像检索任务,并提出了CIRPLANT模型,该模型基于Transformer架构,利用预训练的视觉-语言表征,通过自然语言条件性地修改视觉特征。CIRPLANT在开放域CIRR和窄域Fashion-IQ两个基准上均取得了当前最优性能,证明了视觉-语言预训练在复杂真实场景中细粒度视觉推理任务中的有效性。
We extend the task of composed image retrieval, where an input query consists of an image and short textual description of how to modify the image. Existing methods have only been applied to non-complex images within narrow domains, such as fashion products, thereby limiting the scope of study on in-depth visual reasoning in rich image and language contexts. To address this issue, we collect the Compose Image Retrieval on Real-life images (CIRR) dataset, which consists of over 36,000 pairs of crowd-sourced, open-domain images with human-generated modifying text. To extend current methods to the open-domain, we propose CIRPLANT, a transformer based model that leverages rich pre-trained vision-and-language (V&L) knowledge for modifying visual features conditioned on natural language. Retrieval is then done by nearest neighbor lookup on the modified features. We demonstrate that with a relatively simple architecture, CIRPLANT outperforms existing methods on open-domain images, while matching state-of-the-art accuracy on the existing narrow datasets, such as fashion. Together with the release of CIRR, we believe this work will inspire further research on composed image retrieval.
研究动机与目标
- 为解决现有组合图像检索数据集的局限性,即受限于时尚等窄领域,缺乏开放域、复杂的现实图像。
- 研究在丰富且模糊的视觉与语言上下文中进行细粒度视觉推理,需检测细微属性变化。
- 开发一种有效利用大规模预训练视觉-语言模型的检索方法,以实现开放域的组合图像检索。
- 通过完全标注的子集进行评估,以消除现有数据集中常见的假阴性问题。
- 激发未来关于迭代式、对话式图像检索以及细粒度视觉语言理解的研究。
提出的方法
- 收集CIRR数据集,包含36,000个开放域真实生活图像-文本对,经人工标注修改,强调视觉上相似图像之间的差异。
- 提出CIRPLANT,一种基于Transformer的模型,利用预训练的视觉-语言模型(如OSCAR)联合嵌入图像和文本输入,实现特征组合。
- 将视觉-语言预训练模型适配为执行语言条件性图像特征修改,在保留全局图像特征的同时,通过交叉注意力机制根据文本描述进行特征调整。
- 采用度量学习流程,通过修改后查询特征与候选图像特征之间的ℓ₂-范数距离执行检索。
- 采用非回归、非分类方法,避免推理阶段进行成对评分时的高计算成本。
- 利用Transformer中的自注意力机制关注修改文本中的单个词语,实现对语言线索的细粒度理解。
实验结果
研究问题
- RQ1预训练的视觉-语言模型是否能在具有复杂视觉与语言细微差别的开放域真实图像场景中,有效支持组合图像检索?
- RQ2与LSTM等序列编码模型相比,Transformer架构对单个词语的关注能力是否能显著提升检索性能?
- RQ3视觉-语言预训练在预训练数据分布之外的领域中,其知识迁移程度如何?
- RQ4当修改文本描述的是细微且隐含的变化时,模型在区分视觉上相似图像方面的表现如何?
- RQ5统一模型是否能在开放域和窄域的组合图像检索基准上均实现当前最优性能?
主要发现
- 使用OSCAR初始化的CIRPLANT在Fashion-IQ数据集上达到当前最优性能,优于现有方法(包括TIRG和MAAF)。
- 在CIRR数据集上,CIRPLANT无需任何微调即在召回率上超越所有先前的SOTA方法,展现出强大的零样本泛化能力,适用于开放域图像。
- 在需要细粒度视觉推理的查询子集上,CIRPLANT的召回率显著更高,表明其在捕捉细微语言线索(如“带人绕行”)方面具有优越能力。
- 模型在CIRR上的表现明显低于在Fashion-IQ上的表现,表明由于真实图像的复杂性与多样性,存在领域偏移挑战。
- 定性分析表明,CIRPLANT更能捕捉罕见视觉概念(如“路面”)和隐含需求(如“保持狗的品种”),但在细粒度属性保持任务上仍存在失败。
- 失败案例表明,保持特定属性(如狗的品种)在图像间的一致性仍是主要挑战,提示需要改进细粒度视觉-语言对齐能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。