Skip to main content
QUICK REVIEW

[論文レビュー] Searching for Apparel Products from Images in the Wild

Son N. Tran, Ming Du|arXiv (Cornell University)|Jul 4, 2019
Video Surveillance and Tracking Methods参考文献 22被引用数 4
ひとこと要約

本論文では、YOLoV3およびSSD検出器を用いて、制約のないファッション画像内の衣類領域を局所化し、マルチタスク畳み込みニューラルネットワーク(CNN)で細分化されたカテゴリに分類し、学習された特徴埋め込みを用いてオンラインカタログから視覚的に類似したアイテムを検索するためのディーブラーニングシステムを提案する。色と属性予測を組み込むことで検索精度が向上し、人間による評価ではV1からV3の埋め込みにおいて一貫した向上が確認された。

ABSTRACT

In this age of social media, people often look at what others are wearing. In particular, Instagram and Twitter influencers often provide images of themselves wearing different outfits and their followers are often inspired to buy similar clothes.We propose a system to automatically find the closest visually similar clothes in the online Catalog (street-to-shop searching). The problem is challenging since the original images are taken under different pose and lighting conditions. The system initially localizes high-level descriptive regions (top, bottom, wristwear. . . ) using multiple CNN detectors such as YOLO and SSD that are trained specifically for apparel domain. It then classifies these regions into more specific regions such as t-shirts, tunic or dresses. Finally, a feature embedding learned using a multi-task function is recovered for every item and then compared with corresponding items in the online Catalog database and ranked according to distance. We validate our approach component-wise using benchmark datasets and end-to-end using human evaluation.

研究の動機と目的

  • ソーシャルメディアに投稿された実世界のファッション画像から、正確な視覚的検索を可能にすること。
  • 不自由なポーズ、照明、部分的隠蔽、複数層の衣装による衣類検出の課題に対処すること。
  • 製品タイプ、色、その他の属性を捉えることで、識別的な特徴埋め込みを学習し、検索精度を向上させること。
  • 人間による評価とベンチマークデータセットを用いて、システム全体の検証を実施すること。
  • 分類モデルからの特徴を活用することで、別個の埋め込みネットワークへの依存を減らすこと。

提案手法

  • 衣類に特化したデータで訓練されたYOLOv3およびSSD検出器を用い、ファッション画像内の高レベルの領域(例:トップス、ボトムス、手首用品)を局所化する。
  • 階層的なマルチタスクCNNを用い、検出された領域を146の細分化された衣類カテゴリに分類し、製品タイプ、色、パターン、スリーブ長の共同学習を実施する。
  • ソフトマックスの直前における最終層からの特徴埋め込みを、クエリ画像およびカタログアイテムの両方から抽出し、類似度計算を可能にする。
  • 類似度比較を同じ細分化されたカテゴリ内のアイテムに制限することで、検索の一貫性を向上させる。
  • トレーニング中に背景拡張を適用し、背景色の干渉に対して埋め込みのロバスト性を高める。
  • MTurkを介した人間による評価を用い、異なる埋め込みバージョン(V1〜V3)間の検索品質を比較する。

実験結果

リサーチクエスチョン

  • RQ1衣類に特化したデータで訓練されたマルチボックスオブジェクト検出器が、OpenImagesのような汎用検出器よりも、制約のないファッション画像における衣類領域の局所化で優れた性能を示すか?
  • RQ2色、パターン、スリーブ長などの属性を含むマルチタスク学習が、衣類検索のための特徴埋め込みの質をどのように向上させるか?
  • RQ3トレーニング中に背景拡張を適用することで、実世界の画像における背景のごみに対して埋め込みのロバスト性がどの程度向上するか?
  • RQ4人間による評価において、異なる埋め込みバージョン(V1、V2、V3)のエンドツーエンド検索性能はどのように比較されるか?
  • RQ5分類ネットワークを用いて細分化された分類を実施することで、別個のメトリクス学習段階を必要とせずに、効果的なエンドツーエンド埋め込み抽出器として機能できるか?

主な発見

  • データクリーニングとマルチタスク学習を経て、トップスの細分化分類精度がV1の0.52からV2の0.80に向上し、改善されたデータと共同学習による顕著な向上が示された。
  • 人間による評価では、V2がV1を75%の割合で好まれ、色に配慮した埋め込みが検索品質の向上に寄与していることが示された。
  • V3がV2を67%の割合で好まれたことから、マルチタスクネットワークに13の追加分類タスクを追加することで一貫した改善が得られた。
  • 実世界のファッション画像(例:スカートの0.71の精度)においても強力な性能を維持しており、カタログ画像を超えた良好な一般化性能を示した。
  • 単一のバウンディングボックスによる検出という多層トップスの課題にもかかわらず、背景拡張を適用したトレーニングにより、背景色に対してロバストな性能を示した。
  • 細分化された分類ネットワークからの埋め込みの使用により、別個のメトリクス学習ネットワークの必要性が排除され、パイプラインが簡素化されつつも高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。