Skip to main content
QUICK REVIEW

[论文解读] Dynamically Visual Disambiguation of Keyword-based Image Search

Yazhou Yao, Zeren Sun|arXiv (Cornell University)|May 27, 2019
Advanced Image and Video Retrieval Techniques参考文献 37被引用 6
一句话总结

本文提出一种动态自适应框架,通过自动从搜索结果中发现并选择文本查询,利用显著性引导的深度多实例学习网络去除异常值并学习消歧后的视觉分类器,从而解决基于关键词的图像搜索中的视觉多义性问题。该方法在CMU-Poly-30和MIT-ISD数据集上达到最先进性能,作为网络图像数据集的预处理步骤时,显著提升了下游细粒度识别的准确率。

ABSTRACT

Due to the high cost of manual annotation, learning directly from the web has attracted broad attention. One issue that limits their performance is the problem of visual polysemy. To address this issue, we present an adaptive multi-model framework that resolves polysemy by visual disambiguation. Compared to existing methods, the primary advantage of our approach lies in that our approach can adapt to the dynamic changes in the search results. Our proposed framework consists of two major steps: we first discover and dynamically select the text queries according to the image search results, then we employ the proposed saliency-guided deep multi-instance learning network to remove outliers and learn classification models for visual disambiguation. Extensive experiments demonstrate the superiority of our proposed approach.

研究动机与目标

  • 解决网络图像搜索中的视觉多义性问题,即单个关键词可能对应多个视觉上截然不同的概念。
  • 开发一种能够适应随时间变化的图像搜索结果的动态方法,区别于静态或聚类方法。
  • 无需依赖人工标注资源,自动从搜索结果中发现相关文本查询。
  • 通过过滤噪声图像并选择特定语义的视觉类别,提升网络监督学习的质量。
  • 提供一种预处理步骤,提升从网络图像中学习的效率与准确率。

提出的方法

  • 利用n-gram依赖关系与名词修饰语,从图像搜索结果中动态发现候选文本查询,实现对变化搜索结果的适应。
  • 采用显著性引导的深度多实例学习(MIL)网络,定位物体并为每个图像实例生成判别性特征。
  • 在MIL网络中使用最大池化、平均池化和对数池化操作,将实例级特征聚合为图像级表征。
  • 采用双流网络架构:一个用于物体定位(SGN),一个用于分类(DMIL),其中SGN引导特征学习。
  • 利用学习到的模型将图像分类到不同的视觉语义类别中,有效消解如“coach”或“apple”等多义关键词的歧义。
  • 将该框架作为网络图像学习前的预处理步骤,提升下游任务的数据质量。

实验结果

研究问题

  • RQ1框架能否在时间上动态适应基于关键词的图像搜索结果中视觉语义的变化?
  • RQ2从搜索结果中自动发现文本查询在提升视觉消歧效果方面的有效性如何?
  • RQ3显著性引导的深度MIL网络在减少噪声并提升多义网络图像分类性能方面有多大的改善作用?
  • RQ4图像来源(如Google、Bing、Flickr)的选择在多大程度上影响消歧性能?
  • RQ5使用更深的CNN架构或更多训练样本是否能提升视觉消歧的鲁棒性与准确性?

主要发现

  • 所提方法在CMU-Poly-30数据集上达到最先进性能,相比现有方法显著提升了ACA(平均类别准确率)。
  • 将该框架作为预处理步骤后,CUB-200-2011数据集上的细粒度识别准确率从原始网络图像的71.8%提升至86.3%(结合干净网络图像与原始训练集)。
  • 来自Google和Bing图像搜索引擎的图像在消歧性能上显著优于Flickr的图像。
  • MIL网络中的最大池化操作在ACA指标上优于平均池化和对数池化,表明其在捕捉判别性特征方面的有效性。
  • 更深的CNN架构(如VGG-16)在定位网络图像中的物体方面优于浅层网络(如AlexNet),尤其在复杂背景下表现更优。
  • 每查询增加训练样本数量均能持续提升性能,表明该方法具有良好的数据可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。