Skip to main content
QUICK REVIEW

[論文レビュー] Fashion Retrieval via Graph Reasoning Networks on a Similarity Pyramid

Zhanghui Kuang, Yiming Gao|arXiv (Cornell University)|Aug 30, 2019
Advanced Image and Video Retrieval Techniques参考文献 54被引用数 13
ひとこと要約

本稿では、グラフとして表現される類似度ピラミッドとして、衣類画像間のマルチスケールの局所的およびグローバル類似度をモデル化することで、ファッションリtrievalのためのグラフ推論ネットワーク(GRNet)を提案する。スケール間のノード類似度をグラフ畳み込みネットワーク(GCN)を用いて推論することで、顕著な衣類部品のアライメントが向上し、DeepFashionでは26%のトップ1精度、トップ50では75%の精度を達成し、従来手法を10%以上の向上で上回る、新たなSOTA性能を達成した。

ABSTRACT

Matching clothing images from customers and online shopping stores has rich applications in E-commerce. Existing algorithms encoded an image as a global feature vector and performed retrieval with the global representation. However, discriminative local information on clothes are submerged in this global representation, resulting in sub-optimal performance. To address this issue, we propose a novel Graph Reasoning Network (GRNet) on a Similarity Pyramid, which learns similarities between a query and a gallery cloth by using both global and local representations in multiple scales. The similarity pyramid is represented by a Graph of similarity, where nodes represent similarities between clothing components at different scales, and the final matching score is obtained by message passing along edges. In GRNet, graph reasoning is solved by training a graph convolutional network, enabling to align salient clothing components to improve clothing retrieval. To facilitate future researches, we introduce a new benchmark FindFashion, containing rich annotations of bounding boxes, views, occlusions, and cropping. Extensive experiments show that GRNet obtains new state-of-the-art results on two challenging benchmarks, e.g., pushing the top-1, top-20, and top-50 accuracies on DeepFashion to 26%, 64%, and 75% (i.e., 4%, 10%, and 10% absolute improvements), outperforming competitors with large margins. On FindFashion, GRNet achieves considerable improvements on all empirical settings.

研究の動機と目的

  • グローバル特徴表現の限界、特にロゴやパターンといった判別性の高い局所的詳細が曇る点を是正すること。
  • オクルージョン、クロッピング、視点変化などの変動に対して、グローバルおよび局所類似度を統合的にモデル化することでマッチングのロバスト性を向上させること。
  • 複数スケールにわたる類似度スコアを適応的に精緻化するグラフベースの推論メカニズムを開発すること。
  • オクルージョン、クロッピング、視点、バウンディングボックスを含む豊富なアノテーションを備えた、今後の研究を支援する新規ベンチマーク「FindFashion」を導入すること。

提案手法

  • 複数スケールにおける局所的およびグローバル画像領域間の類似度をノードとして持ち、グラフ構造を形成する類似度ピラミッドを構築する。
  • クエリ画像とギャラリー画像の対応する画像パッチ間の正規化された類似度スコアとして、各ノードを表現する。
  • エッジを介したメッセージパッシングを実行するため、グラフ畳み込みネットワーク(GCN)を適用し、ノード間の相互推論により類似度スコアを精緻化する。
  • 同じスケール内での接続(イントラスケール接続)と、異なるスケール間の接続(インタースケール接続)を導入し、特徴の精緻化を向上させる。
  • 類似度計算のため、複数スケールの特徴抽出戦略を採用し、畳み込みニューラルネットワーク(CNN)を用いて異なる解像度での領域レベル特徴を生成する。
  • 類似度グラフ上でマッチング性能を最適化するため、対照損失を用いてGRNetをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1グローバル表現のみに依存するものと比較して、衣類部品間のマルチスケール類似度をモデル化することで、リtrieval精度が向上するか?
  • RQ2類似度グラフにおけるイントラスケールおよびインタースケール接続は、ファッションリtrievalの性能にどのように影響するか?
  • RQ3類似度ピラミッド上でグラフ推論を実行することで、オクルージョン、クロッピング、視点変化に起因する性能低下をどの程度緩和できるか?
  • RQ4提案されたGRNetは、ハードクロッピングやオクルージョンといった多様で困難なシナリオに一般化してうまく機能するか?
  • RQ5新規のFindFashionベンチマークは、現実的な変動下でのリtrieval性能の評価および分析にどの程度有効であるか?

主な発見

  • DeepFashionベンチマークにおいて、GRNetは26%のトップ1精度、64%のトップ20精度、75%のトップ50精度を達成し、前回のSOTAと比較してそれぞれ4%、10%、10%の絶対的向上を示した。
  • Street2Shopベンチマークでは、トップス、スカート、ドレス、パンツ、アウターの5つのカテゴリすべてで、新たなSOTA結果を樹立した。
  • アブレーションスタディの結果、グラフ推論がトップ1精度に11.6%の絶対的向上をもたらすことが確認され、さらにインタースケール接続(+1.15%)およびインフラスケール接続(+0.9%)による追加の向上も得られた。
  • スケールレベルの増加に伴い、GRNetは一貫した性能向上を示し、2×2および3×3の設定でトップ50精度が73%に達した。これはマルチスケールモデリングが表現力を向上させることを示している。
  • 新規のFindFashionベンチマークでは、Easyプロトコルでトップ20精度65.1%、Hard-Viewで57.9%、Hard-Occlusionで35.0%、Hard-Croppingで48.4%を達成し、KPMおよびベースラインモデルを上回った。
  • ハイパーパramータの選択に対してモデルはロバストであり、異なるプロジェクション次元数やチャネル数に対しても顕著な性能低下が見られず、安定性と一般化能力が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。