Skip to main content
QUICK REVIEW

[论文解读] $c^+$GAN: Complementary Fashion Item Recommendation

Sudhir Kumar, Mithun Das Gupta|arXiv (Cornell University)|Jun 13, 2019
Generative Adversarial Networks and Image Synthesis参考文献 31被引用 16
一句话总结

本文提出 $c^{+}$ GAN,一种条件生成对抗网络,利用从网络爬取的未对齐时尚数据,根据参考上装(如衬衫)生成逼真且互补的时尚单品(如长裤)。通过在判别器中整合均方误差损失、基于DCT系数的感知损失以及简化的透镜效应技术,模型提升了图像质量和多样性,实现了81.25%的搜索引擎标准评分和212.92的多样性评分,并为Bing Shopping的“搭配更佳”功能提供支持。

ABSTRACT

We present a conditional generative adversarial model to draw realistic samples from paired fashion clothing distribution and provide real samples to pair with arbitrary fashion units. More concretely, given an image of a shirt, obtained from a fashion magazine, a brochure or even any random click on ones phone, we draw realistic samples from a parameterized conditional distribution learned as a conditional generative adversarial network ($c^+$GAN) to generate the possible pants which can go with the shirt. We start with a classical cGAN model as proposed by Mirza and Osindero [arXiv:1411.1784] and modify both the generator and discriminator to work on captured-in-the-wild data with no human alignment. We gather a dataset from web crawled data, systematically develop a method which counters the problems inherent to such data, and finally present plausible results based on our technique. We propose simple ideas to evaluate how these techniques can conquer the cognitive gap that exists when arbitrary clothing articles need to be paired with another relevant article, based on similarity of search results.

研究动机与目标

  • 解决在输入数据未对齐且从网络上以自然方式捕获的情况下,推荐互补时尚单品(如为衬衫搭配长裤)的挑战。
  • 开发一种条件生成模型,学习分布 $p(x|y)$,其中 $x$ 为下装,$y$ 为上装,且无需人工标注的配对数据。
  • 在传统信息检索(IR)方法之外,提升时尚单品推荐中的生成质量和多样性。
  • 构建一个可部署的系统,为Bing Shopping中的“搭配更佳”等真实电商功能提供支持。

提出的方法

  • 该模型通过在生成器中引入多损失函数(包含均方误差(MSE)和基于真实图像与生成图像DCT系数的感知损失),扩展了经典的条件生成对抗网络(cGAN)。
  • 在判别器中应用简化的透镜效应技术,以稳定训练过程并提升批量间的模式覆盖度。
  • 使用K-均值聚类对时尚单品进行分组,并在训练中实施模式归一化,以减少模式崩溃。
  • 通过在Bing图片搜索中查询“jeans”或“pants”来评估生成样本的搜索引擎标准(SEC),以验证其逼真性。
  • 通过计算生成批次间联合通道颜色直方图的熵来衡量多样性,熵值越高表示变化越大。
  • 最终模型联合优化对抗损失、MSE、感知损失以及带有透镜效应的重建损失(RLF)方案,以兼顾真实感与多样性。

实验结果

研究问题

  • RQ1条件生成对抗网络能否在无需人工对齐的情况下,仅从网络爬取的未配对上装图像中生成逼真且互补的时尚单品(如长裤)?
  • RQ2与标准GAN相比,感知损失和重建损失在提升生成时尚单品的真实感和多样性方面有何作用?
  • RQ3判别器中简化的透镜效应技术是否能稳定训练过程并提升时尚生成中的模式覆盖度?
  • RQ4生成样本在多大程度上可通过真实世界的搜索引擎(如Bing图片搜索)进行验证?
  • RQ5所提出的方法在生成多样化且合理的搭配组合方面,是否优于基于传统信息检索(IR)的时尚推荐方法?

主要发现

  • 该 $c^{+}$ GAN 模型在搜索引擎标准(SEC)评分中达到81.25%,表明81.25%的生成图像被Bing图片搜索正确识别为长裤或牛仔裤。
  • 多样性评分(DC)达到212.92,反映出生成批次间较高的颜色变化,表明模式覆盖良好且模式崩溃现象得到有效缓解。
  • 引入感知损失后,多样性从164.85(仅含对抗损失与MSE)提升至193.62,同时保持了高质量的图像生成效果。
  • RLF方案在基线对抗模型基础上进一步提升了SEC与DC评分,证明其在稳定训练和提升生成质量方面的有效性。
  • 该模型成功支持了Bing Shopping中的“搭配更佳”功能,已在美国和英国市场上线,适用于“t-shirts”和“sweatshirts”等查询。
  • 该方法在生成多样化、逼真且符合情境的搭配组合方面优于传统基于IR的推荐方法,即使面对未见过的输入图像也能表现良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。