Skip to main content
QUICK REVIEW

[論文レビュー] Video2Shop: Exact Matching Clothes in Videos to Online Shopping Images

Zhi-Qi Cheng, Xiao Wu|arXiv (Cornell University)|Apr 14, 2018
Video Surveillance and Tracking Methods参考文献 20被引用数 8
ひとこと要約

本論文では、LSTMを用いた衣類の軌跡の時系列モデリングと、深い木構造を持つ再構成可能類似度ネットワークを組み合わせることで、動画シーケンスとオンラインショッピング画像の間で正確な衣類照合を実現する深層ニューラルネットワークAsymNetを提案する。本手法は大規模なVideo2Shopデータセットにおいて最先端の性能を達成し、トップ20リtrieval精度で先行手法を大きく上回った。

ABSTRACT

In recent years, both online retail and video hosting service are exponentially growing. In this paper, we explore a new cross-domain task, Video2Shop, targeting for matching clothes appeared in videos to the exact same items in online shops. A novel deep neural network, called AsymNet, is proposed to explore this problem. For the image side, well-established methods are used to detect and extract features for clothing patches with arbitrary sizes. For the video side, deep visual features are extracted from detected object regions in each frame, and further fed into a Long Short-Term Memory (LSTM) framework for sequence modeling, which captures the temporal dynamics in videos. To conduct exact matching between videos and online shopping images, LSTM hidden states, representing the video, and image features, which represent static object images, are jointly modeled under the similarity network with reconfigurable deep tree structure. Moreover, an approximate training method is proposed to achieve the efficiency when training. Extensive experiments conducted on a large cross-domain dataset have demonstrated the effectiveness and efficiency of the proposed AsymNet, which outperforms the state-of-the-art methods.

研究の動機と目的

  • ドメイン間の視覚的差異によって複雑化する、動画とオンラインショッピング画像の間での正確な衣類照合の課題に対処すること。
  • 複数のフレームにわたる衣類アイテムの表現を向上させるために、動画シーケンスの時系列ダイナミクスをモデル化すること。
  • 動画の軌跡と静的ショッピング画像の間で非対称(複数対1)照合を統合的にモデル化できる類似度ネットワークを設計すること。
  • 大規模なオンライン照合にスケーリング可能な効率的な近似学習手法を開発すること。
  • クロスドメイン衣類照合のための、初めての大規模なVideo2Shopベンチマークデータセットを構築すること。

提案手法

  • 2ストリームアーキテクチャを採用:静的ショッピング画像のための画像特徴ネットワーク(IFN)と、動画内の衣類の軌跡のための動画特徴ネットワーク(VFN)。
  • 衣類検出にはFaster R-CNNを、動画フレーム間での衣類パッチの追跡にはKCFトラッカーを用い、一貫性のある軌跡を生成する。
  • LSTMネットワークが動画フレームからの深層視覚特徴を処理し、時系列ダイナミクスをモデル化し、シーケンスレベルの表現を生成する。
  • 類似度ネットワークにおける再構成可能で深い木構造により、動画の軌跡と画像特徴の照合に最適な統合戦略を自動で学習する。
  • 学習時間を25分の1に削減できる近似学習手法を導入し、大規模な学習を効率的に行う。
  • 動画の軌跡埋め込みとショッピング画像特徴の間の類似度スコアを測定するためにコサイン類似度を用いる。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、動画内の衣類とオンラインショッピングカタログ内の同一アイテムとの間で、正確な照合を効果的に行えるか?
  • RQ2動画シーケンスの時系列ダイナミクスをどのようにモデル化すれば、視点の変化や動きの違いに対しても衣類表現のロバスト性が向上するか?
  • RQ3再構成可能な類似度ネットワークアーキテクチャは、非対称(複数対1)照合タスクにおいて、固定された統合戦略を上回る性能を発揮できるか?
  • RQ4近似学習は、大規模な動画からショッピングへの照合タスクにおいて、モデルの有効性を維持したまま学習時間を著しく短縮できるか?
  • RQ5本手法は、現実世界の大規模な実データセットにおいて、最先端の手法と比較して照合精度で優れているか?

主な発見

  • AsymNetは、Video2Shopデータセット全体でトップ20リtrieval精度36.63%を達成し、先行手法を大きく上回った。
  • AlexNet(強力なベースラインとして機能する)と比較して、トップ20精度がほぼ2倍に向上した。
  • ハイヒールやブリーチスなどの特定のカテゴリでは、トップ20精度が48%を超えた。これは、困難なカテゴリでも優れた性能を示している。
  • 近似学習手法により、学習時間を従来手法の1/25に短縮でき、モデルの有効性に劣化は認められなかった。
  • モデルは1秒間に200枚の画像、0.5本の動画軌跡、345組のペアを処理でき、推論効率が非常に高いことを示した。
  • 視覚的分析の結果、装飾パターンや色の違いがあるが同一ではないアイテムからの誤検出(ファルスポジティブ)を効果的に回避していることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。