Skip to main content
QUICK REVIEW

[论文解读] Visual Discovery at Pinterest

Andrew Zhai, Dmitry Kislyuk|arXiv (Cornell University)|Feb 15, 2017
Advanced Image and Video Retrieval Techniques参考文献 35被引用 13
一句话总结

本文介绍了Pinterest的视觉发现引擎,该引擎利用基于深度学习的物体检测和二值化卷积特征,为交互式视觉搜索和推荐系统(如Flashlight和Lens)提供支持。该系统通过实现基于物体的搜索和多样化、语义相关的搜索结果,显著提升了用户参与度,当使用物体检测时,参与度提升了4.9%。

ABSTRACT

Over the past three years Pinterest has experimented with several visual search and recommendation services, including Related Pins (2014), Similar Looks (2015), Flashlight (2016) and Lens (2017). This paper presents an overview of our visual discovery engine powering these services, and shares the rationales behind our technical and product decisions such as the use of object detection and interactive user interfaces. We conclude that this visual discovery engine significantly improves engagement in both search and recommendation tasks.

研究动机与目标

  • 设计并扩展一个生产级视觉发现系统,通过支持交互式、基于物体的视觉搜索来提升用户参与度。
  • 利用从预训练卷积网络提取的二值化深度特征,提升大规模图像搜索中的检索效率和相关性。
  • 将物体检测集成到多样化的视觉发现体验中,包括推荐、搜索以及基于移动摄像头的发现功能。
  • 使用户能够搜索图像中视觉相似的物体,并发现超越精确视觉匹配的语义相关的内容。
  • 评估并优化系统组件(如特征表示、查询归一化和结果融合)以实现真实环境下的部署。

提出的方法

  • 对预训练网络(如ResNet、VGG)的深度卷积特征进行二值化处理,显著降低检索延迟,同时提升相关性。
  • 使用SSD-based物体检测技术,在数十亿张Pinterest图片中识别并索引物体,以支持基于物体的搜索。
  • 将物体检测结果作为Flashlight中的交互式查询点,允许用户点击检测到的物体以发起新的搜索。
  • 设计两阶段架构用于Pinterest Lens:第一阶段为查询理解,用于提取视觉和语义特征;第二阶段为从多个来源(视觉、语义、上下文)融合结果。
  • 对整张图像的物体嵌入进行索引,以实现检索包含目标物体的场景,而非仅匹配整张图像。
  • 根据查询置信度和特征,动态融合来自Flashlight(视觉相似)、图像搜索(语义相似)和物体搜索(上下文相关)的结果。
Figure 1: Pinterest Flashlight: User can select any objects in the image (e.g. lamp, desk, shelf) as a visual search query.
Figure 1: Pinterest Flashlight: User can select any objects in the image (e.g. lamp, desk, shelf) as a visual search query.

实验结果

研究问题

  • RQ1二值化深度特征如何提升大规模视觉搜索系统中的检索效率和相关性?
  • RQ2物体检测对交互式视觉发现系统中的用户参与度有何影响?
  • RQ3如何有效将视觉特征与物体检测集成到统一的推荐与搜索流水线中?
  • RQ4查询理解在提升移动视觉发现中结果多样性与相关性方面发挥什么作用?
  • RQ5如何动态融合多个结果源,以在实时视觉发现系统中优化用户体验?

主要发现

  • 对深度特征进行二值化处理显著降低了检索延迟,同时提升了结果相关性,实现了在数十亿张图像上的可扩展部署。
  • 在Flashlight中集成物体检测使用户参与度提升了4.9%,其中类别一致性是提升相关性的关键驱动因素。
  • 基于SSD的物体检测实现了基于物体的索引,使系统能够检索包含特定物体的场景,从而将视觉搜索的范围从整图匹配扩展至场景级匹配。
  • Pinterest Lens通过动态结果融合,成功结合了视觉相似、语义相似和上下文相关的搜索结果,显著提升了发现质量。
  • 该系统表明,支持交互式、可点击物体的查询显著增强了视觉平台中的用户导航与内容发现能力。
  • 利用丰富的元数据和协同过滤技术提升了物体检测的置信度,从而实现了Flashlight中可靠的基于点的导航功能。
Figure 2: If objects are automatically detected, Flashlight displays a clickable “dot” for faster navigation.
Figure 2: If objects are automatically detected, Flashlight displays a clickable “dot” for faster navigation.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。