Skip to main content
QUICK REVIEW

[論文レビュー] Snap and Find: Deep Discrete Cross-domain Garment Image Retrieval

Yadan Luo, Ziwei Wang|arXiv (Cornell University)|Apr 5, 2019
Advanced Image and Video Retrieval Techniques参考文献 31被引用数 4
ひとこと要約

本稿では、連続する衣類属性をモデル化し、ランドマークアノテーションを必要とせずに注意メカニズムに適した視覚的特徴を学習する、クロスドメイン衣類画像検索を目的とした統合学習フレームワーク「Deep Multi-task Cross-domain Hashing (DMCH)」を提案する。順序付き属性学習を用いて空間的注意を誘導することで、最先端のモデルと比較して306倍高速な推論を達成すると同時に、DeepFashionおよびDARNデータセットにおいて、検索精度と属性予測性能の両面で優れた性能を示した。

ABSTRACT

With the increasing number of online stores, there is a pressing need for intelligent search systems to understand the item photos snapped by customers and search against large-scale product databases to find their desired items. However, it is challenging for conventional retrieval systems to match up the item photos captured by customers and the ones officially released by stores, especially for garment images. To bridge the customer- and store- provided garment photos, existing studies have been widely exploiting the clothing attributes ( extit{e.g.,} black) and landmarks ( extit{e.g.,} collar) to learn a common embedding space for garment representations. Unfortunately they omit the sequential correlation of attributes and consume large quantity of human labors to label the landmarks. In this paper, we propose a deep multi-task cross-domain hashing termed extit{DMCH}, in which cross-domain embedding and sequential attribute learning are modeled simultaneously. Sequential attribute learning not only provides the semantic guidance for embedding, but also generates rich attention on discriminative local details ( extit{e.g.,} black buttons) of clothing items without requiring extra landmark labels. This leads to promising performance and 306$ imes$ boost on efficiency when compared with the state-of-the-art models, which is demonstrated through rigorous experiments on two public fashion datasets.

研究の動機と目的

  • ユーザーが撮影した衣類画像とプロの撮影による商品画像を、クロスドメイン検索において一致させる課題に対処すること。
  • ランドマークアノテーションのコストを低減するために、衣類属性の順序付き表現を視覚的注意のための意味的ガイドとしてモデル化すること。
  • 128ビットのコンactなバイナリコードを用いて、検索の効率を向上させながらも高い精度を維持すること。
  • エンドツーエンドの深層学習フレームワーク内で、クロスドメイン画像検索と順序付き属性予測を同時に最適化すること。
  • 言語的に順序付けられた順序に従って衣類属性間の意味的相関を捉えることで、細分化された識別能を向上させること。

提案手法

  • クロスドメイン画像検索と順序付き属性予測の両方を同時に学習する深層マルチタスク学習フレームワークを提案する。
  • 「黒い」「シルク製の」「短いスleeveの」など、順序付きの属性(例:'black', 'silk', 'short-sleeve')を意味的スーパービジョンとして用い、畳み込み特徴における空間的注意を誘導する。
  • 同一の衣類のユーザー領域およびショップ領域の画像間の類似性を保つために、トリプレット損失を適用して判別性の高いバイナリ埋め込みを学習する。
  • ユーザー画像とショップ画像の両方から視覚的特徴を抽出するために、共有バックボーンを備えたシアン型ネットワークアーキテクチャを採用する。
  • 予測された属性順序に基づいて、判別性の高い局所領域(例:ボタン、襟)を強調する注目モジュールを導入する。
  • ハミング空間探索の効率を高めるために、バイナリコード長を128ビットに固定し、クエリの処理速度を著しく向上させる。

実験結果

リサーチクエスチョン

  • RQ1手動でのランドマークアノテーションを必要とせずに、順序付き衣類属性のモデル化がクロスドメイン衣類画像検索性能の向上に寄与するか。
  • RQ2順序付き属性学習は、衣類画像における細分化された視覚的詳細への注目をどのように向上させるか。
  • RQ3属性予測と画像検索の共同学習が、検索精度と効率の両面でどの程度向上をもたらすか。
  • RQ4本手法は、最先端のモデルと比較して、検索性能および計算効率の両面で優れているか。
  • RQ5属性順序の言語的順序付けが、意味的かつ正確な記述を生成する能力に与える影響は何か。

主な発見

  • DMCHはDARNデータセットでROUGE-Lスコア51.0、DeepFashionデータセットで44.1を達成し、先行手法(DARN: 32.5、FashionNet: 35.8)を著しく上回った。
  • DARNデータセットではCIDErスコア98.6を記録し、FashionNet(76.5)やDARN(53.2)を大きく上回り、優れた順序付き属性生成性能を示した。
  • 順序付き属性学習を活用して空間的注意を誘導することで、アノテートされたランドマークに依存する必要を減らし、検索精度が向上した。
  • DMCHは、128ビットのコンactなバイナリコードを採用したことで、最先端のモデルと比較して推論効率が306倍向上した。
  • 注目可視化により、モデルがスリーブや襟といった判別性の高い領域を正しく特定していることが確認され、'レース'と'lacing'といった属性間の意味的関係も保持されている。
  • 埋め込み空間のt-SNE可視化から、ポーズ、照明、背景が異なる画像に対しても、類似した衣類がクラスタリングされていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。