Skip to main content
QUICK REVIEW

[论文解读] Towards Predicting the Likeability of Fashion Images

Jinghua Wang, Abrar Abdul Nabi|arXiv (Cornell University)|Nov 17, 2015
Aesthetic Perception and Analysis参考文献 46被引用 6
一句话总结

本文提出一种通过深度学习学习语义属性和数据驱动属性来预测时尚图像喜爱度的方法,再利用捕捉高阶属性相关性的链式乘积网络(SPN)对图像对进行排序。该方法在Pinterest数据集上实现了最先进水平的排序准确率,其中数据驱动属性相比语义属性提升了21%。

ABSTRACT

In this paper, we propose a method for ranking fashion images to find the ones which might be liked by more people. We collect two new datasets from image sharing websites (Pinterest and Polyvore). We represent fashion images based on attributes: semantic attributes and data-driven attributes. To learn semantic attributes from limited training data, we use an algorithm on multi-task convolutional neural networks to share visual knowledge among different semantic attribute categories. To discover data-driven attributes unsupervisedly, we propose an algorithm to simultaneously discover visual clusters and learn fashion-specific feature representations. Given attributes as representations, we propose to learn a ranking SPN (sum product networks) to rank pairs of fashion images. The proposed ranking SPN can capture the high-order correlations of the attributes. We show the effectiveness of our method on our two newly collected datasets.

研究动机与目标

  • 开发一种自动化的系统,根据预测的喜爱度对时尚图像进行排序,减少对人工专家的依赖。
  • 解决在有限标注数据下学习时尚图像判别性视觉表征的挑战。
  • 通过无监督聚类和CNN学习,发现时尚图像中未命名的数据驱动视觉模式。
  • 建模时尚属性之间的高阶相关性,以提升图像排序性能。
  • 在从Pinterest和Polyvore新收集的两个数据集上评估该方法,重点关注用户喜爱的图像对。

提出的方法

  • 利用具有共享层的多任务卷积神经网络(CNN),从有限的训练数据中学习语义属性,提升在不同属性类别间的泛化能力。
  • 提出一种迭代算法,以无监督方式联合发现视觉聚类并优化CNN特征表示,将无命名的数据驱动属性识别为视觉模式。
  • 使用语义属性和数据驱动属性的激活向量表示时尚图像,形成一种中级视觉表征。
  • 采用基于排序的链式乘积网络(SPN)建模属性间的复杂高阶相关性,实现鲁棒的成对图像排序。
  • 使用基于损失函数的SPN训练方法,根据图像对的相对评估调整参数:当一张图像的点赞数显著高于另一张时,增大其根节点值的差异。
  • 采用滑动窗口方法检测图像中是否存在数据驱动属性,实现局部属性激活,以支持细粒度表征。

实验结果

研究问题

  • RQ1中级属性(包括语义属性和数据驱动属性)能否有效表征时尚图像以预测用户喜爱度?
  • RQ2在无预先标注名称的情况下发现的数据驱动属性,在排序性能上与传统语义属性相比如何?
  • RQ3链式乘积网络(SPN)能否有效建模高阶属性相关性,从而在图像排序上超越传统排序模型?
  • RQ4数据驱动属性的数量对排序准确率有何影响?需要多少属性才能实现最佳性能?
  • RQ5该模型能否发现与更高或更低喜爱度相关的有意义的属性组合?

主要发现

  • 所提出的基于SPN的排序模型在Pinterest和Polyvore数据集上均优于排序SVM和结构化排序SVM,实现了最高的排序准确率。
  • 数据驱动属性显著优于语义属性,在Pinterest数据集上使排序准确率提升21%,主要得益于更强的判别能力与更高的数量。
  • 使用100个数据驱动属性而非50个,使SPN的排序准确率提升11.2%;但将属性数从150增至192仅带来1.76%的提升,表明收益递减。
  • 该模型成功识别出相关属性组合:例如,肩部、颈部和扭曲区域的三个彩色数据驱动属性联合提升了喜爱度,而其他组合则降低喜爱度。
  • 参数θ(点赞差异的阈值)对性能有显著影响;θ值过低会因差异细微且缺乏共识而降低可靠性和准确率。
  • SPN根节点值能有效预测喜爱度:值越高,点赞数越多,且模型可识别出能提升或降低图像吸引力的具体属性组合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。