Skip to main content
QUICK REVIEW

[论文解读] Image Search with Text Feedback by Additive Attention Compositional Learning

Yuxin Tian, Shawn Newsam|arXiv (Cornell University)|Mar 8, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出了一种基于Transformer的新型方法——加法注意力组合学习(AACL),利用加法注意力机制联合建模图像与文本反馈,以实现更精准的图像检索。AACL通过学习一个全局上下文向量,根据文本描述选择性地调整图像特征,在FashionIQ、Fashion200k以及一个新的Shopping100k基准上实现了最先进性能。

ABSTRACT

Effective image retrieval with text feedback stands to impact a range of real-world applications, such as e-commerce. Given a source image and text feedback that describes the desired modifications to that image, the goal is to retrieve the target images that resemble the source yet satisfy the given modifications by composing a multi-modal (image-text) query. We propose a novel solution to this problem, Additive Attention Compositional Learning (AACL), that uses a multi-modal transformer-based architecture and effectively models the image-text contexts. Specifically, we propose a novel image-text composition module based on additive attention that can be seamlessly plugged into deep neural networks. We also introduce a new challenging benchmark derived from the Shopping100k dataset. AACL is evaluated on three large-scale datasets (FashionIQ, Fashion200k, and Shopping100k), each with strong baselines. Extensive experiments show that AACL achieves new state-of-the-art results on all three datasets.

研究动机与目标

  • 解决通过自然语言反馈描述期望修改来优化图像检索结果的挑战。
  • 克服现有方法依赖卷积特征聚合且缺乏对图像-文本上下文高效全局建模的局限性。
  • 开发一种通用的、端到端可训练的框架,有效组合视觉与语言表征,用于交互式图像检索。
  • 构建一个源自Shopping100k的新颖且具有挑战性的基准数据集,以更好地评估多属性图像修改任务。
  • 在具有复杂多属性反馈的多样化、大规模时尚检索数据集上,持续实现性能提升。

提出的方法

  • 提出一种新颖的多模态加法注意力层,从图像-文本联合表征中计算全局上下文向量。
  • 利用该上下文向量通过可学习的、基于注意力的变换机制,选择性地修改查询图像标记。
  • 将加法注意力模块集成到完全基于Transformer的架构中,实现视觉-语言特征的联合学习。
  • 采用残差式更新机制,通过上下文向量与原始特征共同更新图像标记。
  • 使用可学习的查询向量关注图像和文本特征,实现动态、上下文感知的特征组合。
  • 采用对比学习目标,将组合后的图像-文本表征与潜在空间中的目标图像对齐。

实验结果

研究问题

  • RQ1加法注意力能否有效建模图像与文本的联合上下文,以实现基于自然语言反馈的图像检索?
  • RQ2在多属性图像修改任务中,所提出的AACL框架相较于依赖卷积或点积注意力的现有方法表现如何?
  • RQ3该模型在属性复杂度各异的多样化时尚数据集上,泛化能力如何?
  • RQ4与标准点积注意力相比,加法注意力机制在性能与效率方面的贡献有多大?
  • RQ5不同交互函数(如Hadamard积与加法)如何影响模型组合图像与文本特征的能力?

主要发现

  • 在FashionIQ上,AACL实现了最先进性能,Recall@1达到58.98,Recall@50达到81.29,优于先前方法。
  • 在Fashion200k上,AACL实现Recall@1为55.25,Recall@50为84.66,展现出强大的跨数据集泛化能力。
  • 在包含两个不同属性的新Shopping100k基准上,AACL实现Recall@1为49.20,Recall@50为81.29,创下新SOTA纪录。
  • 消融实验表明,加法注意力相比点积注意力性能更优,Recall@50提升0.69个百分点。
  • 将交互函数中的Hadamard积替换为加法会降低性能,表明非线性交互更有利于模型表现。
  • 注意力可视化显示,模型聚焦于关键语义词(如'sleeves'、'white'、'longer'),并能根据文本动态关注相关图像区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。