Skip to main content
QUICK REVIEW

[论文解读] Searching for Apparel Products from Images in the Wild

Son N. Tran, Ming Du|arXiv (Cornell University)|Jul 4, 2019
Video Surveillance and Tracking Methods参考文献 22被引用 4
一句话总结

本文提出了一种用于街拍服装搜索的深度学习系统,通过 YOLOv3 和 SSD 检测器在非受限的时尚图像中定位服装区域,利用多任务卷积神经网络将这些区域分类为细粒度类别,并通过学习到的特征嵌入从在线目录中检索视觉上相似的物品。该方法通过引入颜色和属性预测,提升了检索准确率,人工评估显示从 V1 到 V3 嵌入版本的性能持续提升。

ABSTRACT

In this age of social media, people often look at what others are wearing. In particular, Instagram and Twitter influencers often provide images of themselves wearing different outfits and their followers are often inspired to buy similar clothes.We propose a system to automatically find the closest visually similar clothes in the online Catalog (street-to-shop searching). The problem is challenging since the original images are taken under different pose and lighting conditions. The system initially localizes high-level descriptive regions (top, bottom, wristwear. . . ) using multiple CNN detectors such as YOLO and SSD that are trained specifically for apparel domain. It then classifies these regions into more specific regions such as t-shirts, tunic or dresses. Finally, a feature embedding learned using a multi-task function is recovered for every item and then compared with corresponding items in the online Catalog database and ranked according to distance. We validate our approach component-wise using benchmark datasets and end-to-end using human evaluation.

研究动机与目标

  • 实现从社交媒体上发布的实际时尚图像中对服装物品进行准确的视觉搜索。
  • 解决由于姿势不受限、光照变化、遮挡以及多层穿搭带来的服装检测挑战。
  • 通过学习能够捕捉产品类型、颜色和其他属性的判别性特征嵌入,提升检索准确率。
  • 通过人工评估和基准数据集对系统进行端到端验证。
  • 通过利用细粒度分类模型中的特征,减少对独立嵌入网络的依赖。

提出的方法

  • 使用在特定服装数据上训练的 YOLOv3 和 SSD 检测器,定位时尚图像中的高层区域(例如上衣、下装、腕部配饰)。
  • 使用分层多任务卷积神经网络,将检测到的区域分类为 146 个细粒度服装类别,联合学习产品类型、颜色、图案和袖长等属性。
  • 从全连接层前的最后特征层提取查询图像和目录物品的特征嵌入,以支持相似度计算。
  • 将相似度比较限制在相同细粒度类别内的物品之间,以提高检索的一致性。
  • 在训练过程中应用背景增强,使嵌入对背景颜色干扰具有鲁棒性。
  • 通过 MTurk 进行人工评估,比较不同嵌入版本(V1 至 V3)的检索质量。

实验结果

研究问题

  • RQ1在特定服装数据上训练的多框目标检测器是否能在非受限时尚图像中对服装区域进行更优的定位,优于 OpenImages 等通用检测器?
  • RQ2通过颜色、图案、袖长等属性进行多任务学习,如何提升用于服装检索的特征嵌入质量?
  • RQ3在训练过程中使用背景增强,能在多大程度上提升嵌入对真实图像中背景杂乱的鲁棒性?
  • RQ4在人工评估下,不同嵌入变体(V1、V2、V3)在端到端检索性能上表现如何?
  • RQ5一个细粒度分类网络是否可以作为有效的端到端嵌入提取器,而无需额外的度量学习阶段?

主要发现

  • 在数据清洗和多任务学习后,上衣的细粒度分类准确率从 V1 的 0.52 提升至 V2 的 0.80,表明数据质量提升和联合学习带来了显著改进。
  • 在人工评估中,V2 相较于 V1 的偏好率达到 75%,表明颜色感知嵌入能有效提升检索质量。
  • V3 相较于 V2 的偏好率达到 67%,表明在多任务网络中增加 13 个额外分类任务带来了持续的性能提升。
  • 该模型在真实世界时尚图像上保持了强劲性能(例如连衣裙的准确率为 0.71),表明其在目录图像之外也具备良好的泛化能力。
  • 尽管单个边界框检测在多层上衣上存在挑战,但通过背景增强训练,系统在背景颜色干扰下表现出良好的鲁棒性。
  • 使用细粒度分类网络中的嵌入替代了独立的度量学习网络,简化了流程,同时保持了高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。