Skip to main content
QUICK REVIEW

[论文解读] Video2Shop: Exact Matching Clothes in Videos to Online Shopping Images

Zhi-Qi Cheng, Xiao Wu|arXiv (Cornell University)|Apr 14, 2018
Video Surveillance and Tracking Methods参考文献 20被引用 8
一句话总结

本文提出 AsymNet,一种用于在视频序列与在线购物图像之间进行精确服装匹配的深度神经网络,通过基于LSTM的服装轨迹时间建模以及具有深层树结构的可重构相似度网络实现。该方法在大规模 Video2Shop 数据集上达到最先进性能,在 top-20 检索准确率方面显著优于先前方法。

ABSTRACT

In recent years, both online retail and video hosting service are exponentially growing. In this paper, we explore a new cross-domain task, Video2Shop, targeting for matching clothes appeared in videos to the exact same items in online shops. A novel deep neural network, called AsymNet, is proposed to explore this problem. For the image side, well-established methods are used to detect and extract features for clothing patches with arbitrary sizes. For the video side, deep visual features are extracted from detected object regions in each frame, and further fed into a Long Short-Term Memory (LSTM) framework for sequence modeling, which captures the temporal dynamics in videos. To conduct exact matching between videos and online shopping images, LSTM hidden states, representing the video, and image features, which represent static object images, are jointly modeled under the similarity network with reconfigurable deep tree structure. Moreover, an approximate training method is proposed to achieve the efficiency when training. Extensive experiments conducted on a large cross-domain dataset have demonstrated the effectiveness and efficiency of the proposed AsymNet, which outperforms the state-of-the-art methods.

研究动机与目标

  • 为解决视频与在线购物图像之间精确服装匹配的挑战,该挑战因跨域视觉差异而复杂化。
  • 对视频序列中的时间动态进行建模,以提升在多帧中对服装物品的表征能力。
  • 设计一种相似度网络,可联合建模视频轨迹与静态购物图像之间的非对称(多对一双向)匹配。
  • 开发一种高效的近似训练方法,以实现大规模在线检索的模型扩展。
  • 建立首个大规模 Video2Shop 基准数据集,用于跨域服装检索。

提出的方法

  • 采用双流架构:图像特征网络(IFN)用于静态购物图像,视频特征网络(VFN)用于视频中的服装轨迹。
  • 使用 Faster R-CNN 进行服装检测,使用 KCF 跟踪器在视频帧之间跟踪服装区域,以生成一致的轨迹。
  • LSTM 网络处理来自视频帧的深层视觉特征,以建模时间动态并生成序列级表征。
  • 相似度网络中采用可重构的深层树结构,自动学习匹配视频轨迹与图像特征的最优融合策略。
  • 引入一种近似训练方法,将训练时间减少至传统方法的 1/25,从而实现高效的规模化学习。
  • 使用余弦相似度度量视频轨迹嵌入与购物图像特征之间的匹配分数。

实验结果

研究问题

  • RQ1深度神经网络能否有效实现视频中服装与在线购物目录中相同服装的精确匹配?
  • RQ2如何对视频序列中的时间动态进行建模,以提升在不同视角和运动下服装表征的鲁棒性?
  • RQ3可重构相似度网络架构是否能在非对称(多对一双向)匹配任务中超越固定融合策略?
  • RQ4近似训练是否在大幅减少大规模视频到购物检索训练时间的同时,仍能保持模型有效性?
  • RQ5在大规模真实世界数据集上,所提方法与最先进方法相比,在检索准确率方面表现如何?

主要发现

  • AsymNet 在整体 Video2Shop 数据集上的 top-20 检索准确率达到 36.63%,显著优于先前方法。
  • 该方法将 AlexNet(作为强基线)的 top-20 准确率几乎提升一倍。
  • 在高跟鞋和长裤等特定类别中,AsymNet 的 top-20 准确率超过 48%,表明在具有挑战性的类别上表现强劲。
  • 近似训练方法将训练时间减少至传统方法的 1/25,且未造成模型有效性的下降。
  • 模型每秒可处理 200 张图像、0.5 条视频轨迹和 345 对样本,展现出强大的推理效率。
  • 可视化分析表明,AsymNet 能够有效避免因外观相似但并非相同物品(尤其是装饰图案或颜色不同的情况)导致的误报。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。