Skip to main content
QUICK REVIEW

[論文レビュー] How To Extract Fashion Trends From Social Media? A Robust Object Detector With Support For Unsupervised Learning

Vijay Gabale, Anand Prabhu Subramanian|arXiv (Cornell University)|Jun 28, 2018
Advanced Neural Network Applications参考文献 11被引用数 10
ひとこと要約

本論文は、ソーシャルメディアからのファッショントレンド抽出を目的とした、ロバストで自己教師あり事前学習を活用したオブジェクト検出フレームワーク、CDSSDを提案する。60K枚のラベルなしファッション画像を用いた自己教師あり事前学習と、Open Images V4の8.2K枚のラベル付き画像を用いた微調整により、2.4Kのテストセットで72.7%のmAPを達成し、複数のファッションカテゴリで最先端の検出器を11–17%上回った。特に、ブーツやハンドバッグのような小サイズのオブジェクトに対して顕著な性能向上を示した。

ABSTRACT

With the proliferation of social media, fashion inspired from celebrities, reputed designers as well as fashion influencers has shortened the cycle of fashion design and manufacturing. However, with the explosion of fashion related content and large number of user generated fashion photos, it is an arduous task for fashion designers to wade through social media photos and create a digest of trending fashion. This necessitates deep parsing of fashion photos on social media to localize and classify multiple fashion items from a given fashion photo. While object detection competitions such as MSCOCO have thousands of samples for each of the object categories, it is quite difficult to get large labeled datasets for fast fashion items. Moreover, state-of-the-art object detectors do not have any functionality to ingest large amount of unlabeled data available on social media in order to fine tune object detectors with labeled datasets. In this work, we show application of a generic object detector, that can be pretrained in an unsupervised manner, on 24 categories from recently released Open Images V4 dataset. We first train the base architecture of the object detector using unsupervisd learning on 60K unlabeled photos from 24 categories gathered from social media, and then subsequently fine tune it on 8.2K labeled photos from Open Images V4 dataset. On 300 X 300 image inputs, we achieve 72.7% mAP on a test dataset of 2.4K photos while performing 11% to 17% better as compared to the state-of-the-art object detectors. We show that this improvement is due to our choice of architecture that lets us do unsupervised learning and that performs significantly better in identifying small objects.

研究の動機と目的

  • ソーシャルメディアにおける膨大なユーザー生成ファッションコンテンツからファッショントレンドを特定・抽出する課題に対処すること。
  • 大規模かつ完全にアノテートされたファッションデータセットの不足を補うために、大量のラベルなしソーシャルメディア画像を効果的に活用できる仕組みを提供すること。
  • 実際のファッション写真に多く見られる、ハンドバッグ、靴、アクセサリーなど多様で小サイズのファッションアイテムのオブジェクト検出性能を向上させること。
  • デザイナーが「レッドドレス」や「ビンテージハンドバッグ」のような自然言語クエリでトレンドを検索できる、スケーラブルでエンドツーエンドのオブジェクト検出システムを開発すること。

提案手法

  • エンドツーエンド学習と自己教師あり事前学習を可能にする畳み込み-デコンボリューションベースのワンショット検出フレームワーク(CDSSD)を採用する。
  • 自己教師あり対照的学習目的関数を用いて、ソーシャルメディアの60K枚のラベルなしファッション画像でモデルを事前学習し、意味的な特徴表現を学習する。
  • Open Images V4の8.2K枚のラベル付きファッション画像を用いて、異なる受容 field を持つデフォルトボックスを備えたマルチスケール特徴マップアーキテクチャで、事前学習済みモデルを微調整する。
  • オブジェクトサイズや外観の変化に耐性を高めるために、ランダムクロッピング、水平反転、色の歪み、幾何変換を含む広範なデータ拡張を適用する。
  • smooth L1ローカライゼーション損失とソフトマックス交差エントロピー信頼度損失を統合したジョイント損失関数を用い、トレーニング中のクラス不均衡を2:1の負例対正例ボックス比で補正する。
  • 重複する予測を低減するために、最終的な検出出力を精緻化するための非最大抑制(NMS)後処理を適用する。

実験結果

リサーチクエスチョン

  • RQ1大規模なラベルなしソーシャルメディアファッション画像を用いた自己教師あり事前学習は、リソースが限られたファッション検出状況において、オブジェクト検出器の性能を顕著に向上させることができるか?
  • RQ2異なる層からの特徴マップの統合を特徴とするCDSSDアーキテクチャは、標準のSSDやYOLO検出器と比較して、小サイズのファッションオブジェクトの検出精度をどのように向上させるか?
  • RQ3多様なファッションカテゴリを含む一貫したセットで学習した単一のオブジェクト検出モデルは、複数のファッションアイテムタイプにわたる一般化能力をどの程度発揮でき、ファッション画像に対する自然言語ベースの検索を可能にするか?
  • RQ4検出ヘッドにデコンボリューショナルレイヤーを統合することで、複雑でごちゃついたファッション画像における特徴表現学習と局所化精度が向上するか?
  • RQ5本手法は、ソーシャルメディアコンテンツ全体のファッションオブジェクト検出を分析することで、色の好みやスタイルの組み合わせといった新しいファッショントレンドを検出できるか?

主な発見

  • 提案されたCDSSDモデルは、ファッション画像の2.4Kテストセットで平均平均精度(mAP)72.7%を達成し、YOLO や SSD といった最先端の検出器を顕著に上回った。
  • 複数のファッションカテゴリで11%から17%の検出性能向上を達成し、特にブーツ、ハイヒール、ハンドバッグのような小サイズオブジェクトで顕著な改善が見られた。
  • 60K枚のラベルなしソーシャルメディアファッション画像を用いた自己教師あり事前学習により、モデルは強固で転送可能な特徴を学習でき、大規模なアノテート済みデータの必要性が低減された。
  • マルチスケール特徴マップとデコンボリューションアップサンプリングを統合したCDSSDアーキテクチャは、局所化誤差を低減し、類似するファッションカテゴリ間の混同を最小限に抑えた。
  • 高い再現率における高い正確性を示しており、実世界のファッション画像解析における強力な一般化性能と信頼性を裏付けた。
  • フレームワークはトレンド分析にも成功した。2015年にパラソロパンツの登場を予測し、2018年にグリーンがハンドバッグの主要カラーになると予測し、ロングドレスのライトグレーの流行や、ブラックジーンズの補色としてのプラムの流行を予測した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。