[论文解读] Self-supervised Visual Attribute Learning for Fashion Compatibility
本文提出S-VAL,一种自监督学习框架,通过三种掩码任务(预测图像颜色直方图、区分无形状局部块、通过Gram矩阵学习全局纹理模式)在无标签情况下学习颜色和纹理感知的视觉特征。在时尚搭配和检索任务上,S-VAL相比先前的自监督方法提升9.5%–16%,即使未使用任何标注信息,仍优于部分有监督方法。
Many self-supervised learning (SSL) methods have been successful in learning semantically meaningful visual representations by solving pretext tasks. However, prior work in SSL focuses on tasks like object recognition or detection, which aim to learn object shapes and assume that the features should be invariant to concepts like colors and textures. Thus, these SSL methods perform poorly on downstream tasks where these concepts provide critical information. In this paper, we present an SSL framework that enables us to learn color and texture-aware features without requiring any labels during training. Our approach consists of three self-supervised tasks designed to capture different concepts that are neglected in prior work that we can select from depending on the needs of our downstream tasks. Our tasks include learning to predict color histograms and discriminate shapeless local patches and textures from each instance. We evaluate our approach on fashion compatibility using Polyvore Outfits and In-Shop Clothing Retrieval using Deepfashion, improving upon prior SSL methods by 9.5-16%, and even outperforming some supervised approaches on Polyvore Outfits despite using no labels. We also show that our approach can be used for transfer learning, demonstrating that we can train on one dataset while achieving high performance on a different dataset.
研究动机与目标
- 为解决现有自监督学习(SSL)方法过度强调形状不变性和颜色不变性的问题,这些方法在时尚搭配任务中表现不佳。
- 开发一种新型SSL框架,明确捕捉颜色和纹理等视觉属性,这些属性对时尚搭配和检索至关重要。
- 证明自监督学习可在无需任何人工标注标签的情况下,实现与有监督方法相当的性能,适用于时尚相关任务。
- 展示在一种时尚数据集上学习的特征可泛化至其他数据集,实现不同时尚基准数据集间的有效迁移学习。
提出的方法
- 该方法引入一种新型自监督掩码任务,通过预测输入图像的颜色直方图来学习主导颜色表征。
- 采用无形状局部块判别(SLPD),将来自同一图像的无形状小块作为正样本对,以促使模型关注纹理和颜色。
- 通过在特征图上计算的Gram矩阵实施纹理判别(TD),以学习全局纹理模式,增强对物体形状的不变性。
- 将颜色直方图预测、SLPD和TD三种组件整合为统一的自监督训练目标。
- 采用对比学习目标端到端训练模型,无需任何类别级别或属性级别的标注。
- 在Polyvore Outfits和DeepFashion数据集上,采用线性分类和检索协议对方法进行评估。
实验结果
研究问题
- RQ1当物体形状并非主要线索时,自监督学习能否被调整以学习颜色和纹理感知的特征?
- RQ2在不使用任何标签的情况下,自监督框架能否在时尚搭配任务中超越有监督基线?
- RQ3不同的自监督掩码任务如何影响下游时尚任务(如搭配和检索)的性能?
- RQ4在一种时尚数据集上学习的特征在多大程度上可迁移至另一不同数据集?
主要发现
- 在Polyvore Outfits时尚搭配基准上,S-VAL相比先前的自监督方法提升9.5%–16%。
- 在DeepFashion In-shop Retrieval任务中,S-VAL将recall@1提升46.5%,recall@10提升81.2%,较ImageNet预训练基线提升超过30个百分点。
- 完整方法(RGB + SLPD + TD)在DeepFashion上实现46.5%的recall@1,即使仅使用无监督预训练,也优于使用有监督三元组损失的基线(63.6% recall@1)。
- 在Polyvore Outfits上训练的模型在Capsule Wardrobes上泛化良好,实现6%–8%的零样本迁移性能提升,优于先前工作。
- 消融研究显示,SLPD和TD比标准实例判别(ID)更有效,尤其是在不希望实现颜色不变性时。
- 仅靠颜色直方图预测提供的收益微乎其微,表明其未强制实现形状不变性,对时尚任务效果较弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。