[论文解读] Learning Similarity Conditions Without Explicit Supervision
该论文提出SCE-Net,一种弱监督深度学习模型,可联合学习多种视觉相似性条件(如颜色、形状和类别),且在训练过程中无需显式标签。通过使用条件权重分支动态分配所学相似性条件掩码对图像对的相关性,该模型在服装搭配兼容性、三元组预测和填空任务上均达到最先进性能,甚至能泛化到未见类别。
Many real-world tasks require models to compare images along multiple similarity conditions (e.g. similarity in color, category or shape). Existing methods often reason about these complex similarity relationships by learning condition-aware embeddings. While such embeddings aid models in learning different notions of similarity, they also limit their capability to generalize to unseen categories since they require explicit labels at test time. To address this deficiency, we propose an approach that jointly learns representations for the different similarity conditions and their contributions as a latent variable without explicit supervision. Comprehensive experiments across three datasets, Polyvore-Outfits, Maryland-Polyvore and UT-Zappos50k, demonstrate the effectiveness of our approach: our model outperforms the state-of-the-art methods, even those that are strongly supervised with pre-defined similarity conditions, on fill-in-the-blank, outfit compatibility prediction and triplet prediction tasks. Finally, we show that our model learns different visually-relevant semantic sub-spaces that allow it to generalize well to unseen categories.
研究动机与目标
- 解决现有度量学习模型依赖强监督来学习相似性条件的局限性,该局限性阻碍了其在未见类别上的泛化能力。
- 以弱监督方式学习多个相似性条件(如颜色、形状、类别)的解耦且语义有意义的视觉子空间。
- 通过将相似性条件作为潜在变量学习而不依赖预定义标签,使模型能够泛化到新类别和属性。
- 证明加权组合所学子空间优于单一子空间模型,即使后者为强监督训练。
- 表明模型学习到的子空间具有视觉可解释性和语义相关性,例如时尚物品中的性别、鞋跟高度和闭合类型。
提出的方法
- 模型使用共享的卷积神经网络(CNN)将输入图像嵌入到通用特征空间,生成视觉特征$V_1$和$V_2$。
- 条件权重分支基于视觉特征生成一个动态权重向量$W_1, ..., W_M$,用于确定$M$个所学相似性条件掩码中每个掩码的相关性。
- 每个相似性条件掩码$C_i$通过与视觉特征进行逐元素相乘,生成掩码嵌入,再经由条件权重加权,形成最终表示$E_1$和$E_2$。
- 最终相似性分数基于$E_1$与$E_2$之间的距离计算,模型端到端训练以优化下游任务。
- 该方法将相似性条件的数量和身份视为潜在变量,在训练过程中无显式监督下进行学习。
- 模型利用类似注意力的机制,根据输入图像内容上下文性地分配条件掩码,实现灵活且自适应的相似性推理。
实验结果
研究问题
- RQ1深度学习模型能否在无显式监督的情况下学习多个解耦的视觉相似性条件(如颜色、形状、类别)?
- RQ2与固定或预定义子空间相比,对所学相似性条件掩码采用动态注意力加权是否能提升性能?
- RQ3弱监督模型是否能在强监督不可用的测试阶段有效泛化到未见类别和属性?
- RQ4多个所学语义子空间的加权组合是否比将相似性学习限制在单一子空间更有效?
- RQ5所学子空间是否对应于视觉上合理且可解释的属性,如时尚物品中的鞋跟高度、性别或闭合类型?
主要发现
- 在使用四个相似性条件掩码时,SCE-Net在UT-Zappos50k测试集上比强监督训练的SOTA模型CSN提升3.2%。
- 即使仅使用三个相似性条件掩码,SCE-Net在UT-Zappos50k测试集上仍达到7.53%的错误率,优于使用四个掩码且经强监督训练的CSN模型。
- 模型在未见类别上泛化良好,体现在其在零样本搭配和检索任务中表现更优。
- t-SNE可视化结果证实,所学子空间编码了语义上有意义的属性:例如,一个子空间可区分鞋类(短靴与拖鞋),另一个可区分闭合类型(系带与套脚式),另一个可区分鞋跟高度与性别。
- 动态条件权重分支在表示学习方面优于固定或预定义子空间,表明多子空间融合优于单子空间学习。
- 所需相似性条件掩码的数量随数据集复杂度增加而上升,表明模型容量应随视觉属性多样性而扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。