Skip to main content
QUICK REVIEW

[論文レビュー] Towards Predicting the Likeability of Fashion Images

Jinghua Wang, Abrar Abdul Nabi|arXiv (Cornell University)|Nov 17, 2015
Aesthetic Perception and Analysis参考文献 46被引用数 6
ひとこと要約

本論文では、深層学習を用いて意味的属性とデータ駆動型属性を学習し、高次元の属性相関を捉えることができる和積ネットワーク(SPN)を用いて、ファッション画像の好まれやすさを予測・順位付けする手法を提案する。この手法は、Pinterestデータ上で意味的属性を上回る21%の性能向上を達成し、最先端の順位付け精度を実現した。

ABSTRACT

In this paper, we propose a method for ranking fashion images to find the ones which might be liked by more people. We collect two new datasets from image sharing websites (Pinterest and Polyvore). We represent fashion images based on attributes: semantic attributes and data-driven attributes. To learn semantic attributes from limited training data, we use an algorithm on multi-task convolutional neural networks to share visual knowledge among different semantic attribute categories. To discover data-driven attributes unsupervisedly, we propose an algorithm to simultaneously discover visual clusters and learn fashion-specific feature representations. Given attributes as representations, we propose to learn a ranking SPN (sum product networks) to rank pairs of fashion images. The proposed ranking SPN can capture the high-order correlations of the attributes. We show the effectiveness of our method on our two newly collected datasets.

研究の動機と目的

  • 人間の専門家に依存しない自動化されたファッション画像順位付けシステムの開発。
  • 限られたラベル付きデータからのファッション画像の判別的視覚表現の学習という課題への対処。
  • 教師なしクラスタリングとCNN学習を用いて、名前が付いていないデータ駆動型視覚パターンを発見すること。
  • ファッション属性間の高次相関をモデル化し、画像順位付け性能の向上を図ること。
  • PinterestおよびPolyvoreから新たに収集した2つのデータセットを用いて、ユーザーが好む画像ペアを焦点として評価すること。

提案手法

  • 限られた訓練データから意味的属性を学習するため、共有層を有するマルチタスク畳み込みニューラルネットワーク(CNN)を活用し、属性カテゴリ間の一般化を向上させる。
  • 教師なしの方法で視覚クラスタとCNN特徴表現を同時に発見・改善する反復的アルゴリズムを提案し、事前に定義された名前が無い視覚パターンとしてデータ駆動型属性を同定する。
  • 意味的属性およびデータ駆動型属性からの活性化ベクトルを用いて、ファッション画像をミドルレベルの視覚表現として表現する。
  • 複雑な高次元属性相関をモデル化するため、順位付けに適した和積ネットワーク(SPN)を採用し、堅牢なペアワイズ画像順位付けを実現する。
  • 画像ペアの相対的評価に基づいてパラメータを調整する損失関数を用いてSPNを訓練する。具体的には、一方の画像が他方よりも著しく多くの「いいね」を得ている場合、その根ノードの値の差を拡大する。
  • 局所的な属性活性化を可能にするため、スライディングウィンドウアプローチを用いてデータ駆動型属性の存在を検出する。

実験結果

リサーチクエスチョン

  • RQ1意味的属性とデータ駆動型属性の両方を含むミドルレベルの属性は、ユーザーの好まれやすさを予測するためのファッション画像表現として効果的か?
  • RQ2人間がラベル付けしないで発見されたデータ駆動型属性は、従来の意味的属性と比較して順位付け性能で優れているか?
  • RQ3和積ネットワーク(SPN)は、従来の順位付けモデルを上回る高次元属性相関を効果的にモデル化できるか?
  • RQ4データ駆動型属性の数が順位付け精度に与える影響は何か?最適な性能を得るにはどの程度の数が必要か?
  • RQ5モデルは、好まれやすさが高くなるか低くなるかに関連する有意義な属性の組み合わせを発見できるか?

主な発見

  • 提案されたSPNベースの順位付けモデルは、順位付けSVMおよび構造的順位付けSVMを上回り、PinterestおよびPolyvoreの両データセットで最高の順位付け精度を達成した。
  • データ駆動型属性は意味的属性を著しく上回り、Pinterestデータセットでは識別力の高さと数の多さのおかげで順位付け精度が21%向上した。
  • 100個のデータ駆動型属性を使用した場合と50個のときを比較すると、SPNの順位付け精度が11.2%向上したが、150個から192個に増やした際にはわずか1.76%の向上にとどまり、収益逓減の傾向が見られた。
  • モデルは相関する属性の組み合わせを効果的に同定した。例えば、肩、首、ねckの領域に位置する3つのカラフルなデータ駆動型属性が同時に存在すると、好まれやすさが向上する一方、他の組み合わせでは逆に低下させる要因となった。
  • θ(「いいね」の差の閾値)のパラメータは性能に強く影響を与える。θの値が低いと、微細で合意が得にくい差のため、信頼性と精度が低下する。
  • SPNの根ノード値は好まれやすさを効果的に予測できる。高い値を示すほど「いいね」の数が多くなり、特定の属性の組み合わせが画像の魅力を高めるか低下させるかを同定できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。