Skip to main content
QUICK REVIEW

[論文レビュー] $c^+$GAN: Complementary Fashion Item Recommendation

Sudhir Kumar, Mithun Das Gupta|arXiv (Cornell University)|Jun 13, 2019
Generative Adversarial Networks and Image Synthesis参考文献 31被引用数 16
ひとこと要約

本論文では、ウェブからクロールしたアラインされていないファッションデータを用い、参照画像のトップス(例:シャツ)に対して現実的で補完的なファッションアイテム(例:パンツ)を生成する条件付き生成対抗ネットワーク、$c^{+}$ GANを提案する。MSE損失、DCT係数を用いた知覚的損失、および簡素化されたレンズィング技術を識別器に統合することで、画像品質と多様性が向上し、81.25%の検索エンジン基準スコアと212.92の多様性スコアを達成。このモデルはBing Shoppingの「Goes Well With」機能を実装している。

ABSTRACT

We present a conditional generative adversarial model to draw realistic samples from paired fashion clothing distribution and provide real samples to pair with arbitrary fashion units. More concretely, given an image of a shirt, obtained from a fashion magazine, a brochure or even any random click on ones phone, we draw realistic samples from a parameterized conditional distribution learned as a conditional generative adversarial network ($c^+$GAN) to generate the possible pants which can go with the shirt. We start with a classical cGAN model as proposed by Mirza and Osindero [arXiv:1411.1784] and modify both the generator and discriminator to work on captured-in-the-wild data with no human alignment. We gather a dataset from web crawled data, systematically develop a method which counters the problems inherent to such data, and finally present plausible results based on our technique. We propose simple ideas to evaluate how these techniques can conquer the cognitive gap that exists when arbitrary clothing articles need to be paired with another relevant article, based on similarity of search results.

研究の動機と目的

  • 入力データがウェブから収集されたウェブ上で得られた未アラインデータである状況において、補完的ファッションアイテム(例:シャツに対するパンツ)を推薦する課題に対処すること。
  • 人為的アノテーションによるペアリングが不要な条件下で、$x$(ボトムス)の分布$p(x|y)$を学習する条件付き生成モデルを開発すること。ここで$y$はトップスを表す。
  • 従来の情報検索(IR)手法を超えて、ファッションアイテム推薦における生成品質と多様性を向上させること。
  • 実世界の電子商取引機能(例:Bing Shoppingの「Goes Well With」)を支えるデプロイ可能なシステムを構築すること。

提案手法

  • 従来の条件付きGAN(cGAN)を拡張し、実画像と生成画像のDCT係数に基づく知覚的損失とMSE損失を組み合わせたマルチ損失ジェネレータを採用する。
  • 訓練の安定化とバッチ間のモードカバレッジの向上を図るため、識別器に簡素化されたレンズィング技術を適用する。
  • トレーニング中にモード正規化を強制するために、K-meansクラスタリングを用いてファッションアイテムをグループ化する。これにより、モード崩壊が軽減される。
  • 生成サンプルは、Bing Image Searchで「ジーンズ」または「パンツ」と検索することで、検索エンジン基準(SEC)を用いて評価される。
  • 多様性は、生成バッチ全体におけるチャネル別カラーヒストограмのエントロピーで測定され、高いエントロピーはより高い変動性を示す。
  • 最終的なモデルは、対抗損失、MSE損失、知覚的損失、およびRL(レンズィング付き再構成損失)スキームを組み合わせ、リアルさと多様性を同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1人為的アライメントがなく、ウェブからクロールされたトップスの画像(例:シャツ)から、未ペアの画像データを用いて、現実的で補完的なファッションアイテム(例:パンツ)を条件付きGANが生成可能か?
  • RQ2知覚的損失および再構成損失は、標準GANと比較して、生成されたファッションアイテムのリアルさと多様性をどのように向上させるか?
  • RQ3識別器に簡素化されたレンズィング技術を適用することで、ファッション生成における訓練の安定化とモードカバレッジの向上が図れるか?
  • RQ4Bing Image Searchのような実世界の検索エンジンを用いて、生成されたサンプルをどの程度検証できるか?
  • RQ5提案手法は、従来のIRベースのファッション推薦手法に比べて、多様で現実的かつ文脈的に妥当なコーディネートを生成する点で優れているか?

主な発見

  • $c^{+}$ GANモデルは、Bing Image Searchで「ジーンズ」または「パンツ」と検索した際に、81.25%の生成画像が正しく認識されたとして、検索エンジン基準(SEC)スコア81.25%を達成した。
  • 多様性スコア(DC)は212.92に達し、生成バッチ全体における色の変動が顕著で、効果的なモードカバレッジとモード崩壊の低減を示している。
  • 知覚的損失を追加することで、多様性は164.85(対抗損失+MSE)から193.62に向上したが、画像品質は維持された。
  • RL(レンズィング付き再構成損失)スキームは、ベースラインの対抗モデルに比べてSECスコアとDCスコアの両方を向上させ、訓練の安定化と生成品質の向上の有効性を示した。
  • このモデルは、米国および英国市場で「Tシャツ」や「スウェットシャツ」などのクエリに対して、Bing Shoppingの「Goes Well With」機能を実際に実装している。
  • 本手法は、未学習の入力画像に対しても、多様で現実的かつ文脈的に妥当なコーディネートを生成する点で、従来のIRベースのアプローチを上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。