Skip to main content
QUICK REVIEW

[論文レビュー] Context-Aware Visual Compatibility Prediction

Guillem Cucurull, Perouz Taslakian|arXiv (Cornell University)|Feb 10, 2019
Aesthetic Perception and Analysis参考文献 37被引用数 9
ひとこと要約

本稿では、互いに相性の良いアイテム同士の関係的情報を活用して埋め込みの質を向上させる、文脈に配慮したグラフニューラルネットワークモデルを提示する。製品の埋め込みを周囲みの文脈に応じて条件づけることで、Polyvore、Fashion-Gen、Amazonのデータセットにおいて、推論時に使用する文脈を増やすほど精度が向上し、最先端の性能を達成した。

ABSTRACT

How do we determine whether two or more clothing items are compatible or visually appealing? Part of the answer lies in understanding of visual aesthetics, and is biased by personal preferences shaped by social attitudes, time, and place. In this work we propose a method that predicts compatibility between two items based on their visual features, as well as their context. We define context as the products that are known to be compatible with each of these item. Our model is in contrast to other metric learning approaches that rely on pairwise comparisons between item features alone. We address the compatibility prediction problem using a graph neural network that learns to generate product embeddings conditioned on their context. We present results for two prediction tasks (fill in the blank and outfit compatibility) tested on two fashion datasets Polyvore and Fashion-Gen, and on a subset of the Amazon dataset; we achieve state of the art results when using context information and show how test performance improves as more context is used.

研究の動機と目的

  • 個々のアイテムペアを独立して扱う既存のファッション相性予測モデルの限界、すなわち文脈的関係を考慮しないことに対処する。
  • 各製品と相性の良いアイテムの集合(関係的文脈)を埋め込み学習プロセスに統合することで、相性予測を改善する。
  • テスト時の性能に与える影響を評価するために、近隣情報(文脈)の量を変化させた際のモデル性能の変化を調査する。
  • 性別を越えたファッションスタイルの変化(ドメインシフト)に対して、モデルの頑健性を示す。
  • グラフニューラルネットワークを用いて文脈的関係的情報を統合することで、相性予測の分野における新たな最先端の性能を確立する。

提案手法

  • アイテムとその相性関係を、ノードがアイテム、エッジが相性を示す非同質なグラフとして表現する。
  • 隣接する相性の良いアイテムからの特徴を集約することで、文脈に配慮したノード埋め込みを計算する、グラフ畳み込みエンコーダを備えたグラフオートエンコーダフレームワークを用いる。
  • 文脈に応じた埋め込みを用いて、アイテムペア間の相性スコアを計算するデコーダを適用する。一般的にはドット積や類似度関数を用いる。
  • 既知の相性ペアを用いたリンク予測の目的関数に基づき、再構成誤差を最適化することで、モデルをエンドツーエンドで学習する。
  • 推論時、各アイテムのkホップ近隣の文脈に条件づけて予測を行うことで、文脈の深さが性能に与える影響を評価する。
  • ある性別の衣類で学習し、別の性別でテストすることで、モデルのクロスドメイン一般化を実装し、スタイルや文脈のシフトに対する頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1相性の良いアイテムからの文脈的情報を統合することで、個別ペアのみを考慮する手法に比べ、ファッション相性予測の性能はどの程度向上するか?
  • RQ2近隣文脈(例:kホップ近傍)の量を増やすことで、相性タスクにおけるモデル性能はどの程度向上するか?
  • RQ3文脈に配慮したモデルは、非文脈的ベースラインに比べ、未観測ドメイン(例:性別を越えたファッションスタイル)に対してもより良い一般化性能を示せるか?
  • RQ4製品グラフとしての関係的情報を用いることで、標準的なファッション相性ベンチマークで最先端の性能が達成できるか?
  • RQ5文脈を段階的に追加した場合、Polyvore、Fashion-Gen、Amazonの各データセットおよびオシャレ完成(outfit completion)やリンク予測といったタスクにおけるモデルの性能はどのように変化するか?

主な発見

  • PolyvoreのFITB(穴埋め)およびオシャレ相性タスクにおいて、最先端の性能を達成。kを0から15に増やすことでAUCが0.76から0.99に向上した。
  • Fashion-Genデータセットでは、kが増えるにつれて性能が安定して向上し、k=10でプラトーに達する。k=10の「一緒に購入された」リンク予測タスクではAUCが0.94に達した。
  • Amazonデータセットでは、「一緒に購入された」リンク予測タスクでSOTAを達成(k=10で97.1%の精度)、k=0のベースライン(57.9%)を大きく上回った。
  • クロスジェンダーの転移学習では、k=10のモデルが女性の衣類で学習した後、男性の衣類で97.1%の精度を達成し、ドメインシフトに対する強い頑健性を示した。
  • モデルの性能は文脈に強く依存しており、図6に示すように、パンツと靴のペアの相性予測結果が、アイテムの文脈によって変化することが確認された。
  • 関係的情報を活用することで、モデルはより適応的かつ汎用的になる。未観測のスタイルに対しても性能が向上し、性別カテゴリ間での転移性も向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。