[论文解读] Training and challenging models for text-guided fashion image retrieval
本文引入了挑战性时尚查询(CFQ)数据集,这是一个新的文本引导时尚图像检索基准,包含用于描述准确性和图像相关性的正负标签。它提出了一种残差注意力融合机制,保留了多模态预训练对齐,通过更优的特征对齐和弱监督领域自适应,在Fashion IQ上实现了最先进性能。
Retrieving relevant images from a catalog based on a query image together with a modifying caption is a challenging multimodal task that can particularly benefit domains like apparel shopping, where fine details and subtle variations may be best expressed through natural language. We introduce a new evaluation dataset, Challenging Fashion Queries (CFQ), as well as a modeling approach that achieves state-of-the-art performance on the existing Fashion IQ (FIQ) dataset. CFQ complements existing benchmarks by including relative captions with positive and negative labels of caption accuracy and conditional image similarity, where others provided only positive labels with a combined meaning. We demonstrate the importance of multimodal pretraining for the task and show that domain-specific weak supervision based on attribute labels can augment generic large-scale pretraining. While previous modality fusion mechanisms lose the benefits of multimodal pretraining, we introduce a residual attention fusion mechanism that improves performance. We release CFQ and our code to the research community.
研究动机与目标
- 为解决现有文本引导时尚检索基准的局限性,这些基准缺乏负样本标签且存在噪声正样本标注。
- 开发一种更鲁棒的评估框架,将描述准确性与图像相关性分离,实现对模型行为的更细粒度分析。
- 通过利用多模态预训练和领域特定的弱监督,提升文本引导时尚图像检索的性能。
- 设计一种模态融合机制,保留预训练过程中学习到的文本与图像特征之间的对齐,避免性能下降。
- 通过在非时尚文本引导检索数据集上进行评估,证明所提方法的通用性。
提出的方法
- 作者引入了挑战性时尚查询(CFQ)数据集,其中包含针对描述准确性与基于描述的图像相似性的真人标注正负标签。
- 他们利用iMaterialist-Fashion数据集中的属性标签生成相对描述,从而在大规模时尚数据上实现弱监督预训练。
- 提出了一种残差注意力融合机制,以在不破坏CLIP预训练中已有对齐的前提下,融合图像与文本特征。
- 该方法在Fashion IQ数据集上微调CLIP,并进一步利用iMaterialist-Fashion中的合成描述进行领域自适应,从而保留多模态预训练的优势。
- 采用双指标评估模型:准确率mAP(用于描述正确性)和相关性mAP(用于描述变化下的图像相似性)。
- 在多个数据集(包括Birds-to-Words和MIT-States)上评估该方法,以证明其在时尚以外任务中的泛化能力。
实验结果
研究问题
- RQ1在描述准确性和图像相关性中引入负样本标签,如何提升对文本引导时尚图像检索模型的评估效果?
- RQ2来自CLIP的多模态预训练在性能中起到多大作用?模态融合是否会削弱这一优势?
- RQ3使用属性标签进行弱监督预训练,是否能在无需完整标注的情况下提升文本引导检索性能?
- RQ4所提出的残差注意力融合机制与现有融合方法相比,在保留预训练对齐和提升检索准确率方面表现如何?
- RQ5该方法在非时尚文本引导检索基准上的泛化能力如何?
主要发现
- CFQ数据集通过将描述准确性和图像相关性分离,提供了更严格的评估,揭示了Fashion IQ主要评估的是准确率分量。
- 所提出的残差注意力融合机制通过保留预训练中学习到的文本与图像特征对齐,显著优于CLIP基线模型。
- 多模态预训练是性能的主要决定因素,其优势超过复杂融合机制带来的收益。
- 在Fashion IQ上微调并结合iMaterialist-Fashion属性进行弱监督预训练,进一步提升了性能,尤其在罕见或细微属性变化上表现更优。
- 该模型在CFQ的整体相关性指标上达到38.0 mAP,表明尽管已达到最先进水平,但仍有显著提升空间。
- 该方法在非时尚数据集上泛化良好,在Birds-to-Words和MIT-States上无需超参数调优即达到最先进或接近最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。