Skip to main content
QUICK REVIEW

[论文解读] Joint Visual-Textual Embedding for Multimodal Style Search

Gil Sadeh, Lior Fritz|arXiv (Cornell University)|Jun 15, 2019
Generative Adversarial Networks and Image Synthesis参考文献 26被引用 4
一句话总结

本文提出了一种用于多模态时尚风格搜索的联合视觉-文本嵌入模型,支持通过图像和文本查询对搜索结果进行直观的迭代优化。该方法提出了一种新颖的对比损失函数——小批量匹配检索(MBMR)损失,其性能优于三元组损失,并结合了查询运算与学习到的属性过滤机制,在包含多模态评估指标的新基准上实现了最先进性能。

ABSTRACT

We introduce a multimodal visual-textual search refinement method for fashion garments. Existing search engines do not enable intuitive, interactive, refinement of retrieved results based on the properties of a particular product. We propose a method to retrieve similar items, based on a query item image and textual refinement properties. We believe this method can be leveraged to solve many real-life customer scenarios, in which a similar item in a different color, pattern, length or style is desired. We employ a joint embedding training scheme in which product images and their catalog textual metadata are mapped closely in a shared space. This joint visual-textual embedding space enables manipulating catalog images semantically, based on textual refinement requirements. We propose a new training objective function, Mini-Batch Match Retrieval, and demonstrate its superiority over the commonly used triplet loss. Additionally, we demonstrate the feasibility of adding an attribute extraction module, trained on the same catalog data, and demonstrate how to integrate it within the multimodal search to boost its performance. We introduce an evaluation protocol with an associated benchmark, and compare several approaches.

研究动机与目标

  • 解决时尚搜索中直观、交互式优化的挑战,使用户能够基于颜色、图案或风格等属性修改,查找相似商品。
  • 构建一个联合视觉-文本嵌入空间,实现仅通过文本查询对图像进行语义操作,而无需成对的前后图像数据。
  • 设计一种训练目标——小批量匹配检索(MBMR),在弱监督的目录数据设置下,提升检索性能,优于标准三元组损失。
  • 评估端到端训练的属性提取模块在通过软文本过滤增强多模态搜索效果方面的有效性。
  • 建立一个新基准,采用结合视觉与文本相关性的多模态评估指标,以公平比较不同检索方法。

提出的方法

  • 使用一种新颖的目标函数——小批量匹配检索(MBMR)损失,训练联合视觉-文本嵌入模型,通过交叉熵损失最大化小批量内匹配图像-文本对之间的余弦相似度。
  • 定义一个共享嵌入空间,将每个商品图像及其目录元数据(文本)映射到同一向量空间,支持如向量运算等语义操作。
  • 引入一个在噪声目录数据上训练的多标签属性分类器,从图像中提取时尚属性(如颜色、图案),而无需额外标注。
  • 结合两种检索策略:(1) 在共享嵌入空间中通过向量运算进行查询运算;(2) 通过预测属性进行软过滤,以优化搜索结果。
  • 使用视觉与文本归一化折扣累积收益(nDCG)得分的几何平均值作为最终的多模态评估指标。
  • 采用多任务目标端到端训练模型,包括MBMR损失与辅助属性分类损失,以提升泛化能力与整体性能。

实验结果

研究问题

  • RQ1联合视觉-文本嵌入空间是否能仅通过图像和文本查询实现有效且直观的时尚搜索结果优化?
  • RQ2所提出的MBMR损失是否在学习具有判别力的时尚检索嵌入空间方面优于标准三元组损失?
  • RQ3在仅使用噪声目录数据训练的端到端属性提取模块,能在多大程度上提升多模态搜索性能?
  • RQ4查询运算与软属性过滤的结合在实现高质量、语义精准的检索结果方面有多高效?
  • RQ5采用多模态指标(V-nDCG、T-nDCG、MM)的新评估协议是否能可靠且公平地比较真实世界时尚数据上的不同多模态搜索方法?

主要发现

  • MBMR损失相比三元组损失收敛更快,性能更优,在验证集上top-20准确率提升了5.5个百分点。
  • 查询运算与软属性过滤结合的方法(QA+SAF)在多模态nDCG上达到最高分0.612,显著优于单一方法。
  • 在‘颜色’类查询中,QA+SAF的V-nDCG为0.621,T-nDCG为0.591,显示出视觉与文本相关性之间的良好平衡。
  • 仅在噪声目录数据上训练的属性提取模块即可生成可靠预测,其中‘领型’与‘风格’类别的T-nDCG得分分别达到0.628与0.563。
  • 所提出的多模态评估指标(MM = √(V-nDCG × T-nDCG))稳定且有效,适用于方法比较,且在不同查询类型下结果一致。
  • 图5的定性分析表明,QA+SAF生成的结果比单一方法更相关且语义一致,尤其在涉及多个属性的复杂查询中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。