Skip to main content
QUICK REVIEW

[论文解读] From visual words to a visual grammar: using language modelling for image classification

Antonio Foncubierta–Rodríguez, Henning Müller|arXiv (Cornell University)|Mar 16, 2017
Advanced Image and Video Retrieval Techniques参考文献 22被引用 4
一句话总结

本文提出一种视觉语法模型,将语言学概念——意义性、同义性与多义性——应用于图像分类任务,以改进基于视觉词袋(BoVW)框架的性能。通过将语言建模原则应用于视觉词的过滤与重加权,该方法在提升分类准确率的同时减少描述符尺寸,结合余弦相似度后,其性能优于基线BoVW方法,并在描述符长度仅为Fisher向量几分之一的情况下,达到与之相当的分类性能。

ABSTRACT

The Bag--of--Visual--Words (BoVW) is a visual description technique that aims at shortening the semantic gap by partitioning a low--level feature space into regions of the feature space that potentially correspond to visual concepts and by giving more value to this space. In this paper we present a conceptual analysis of three major properties of language grammar and how they can be adapted to the computer vision and image understanding domain based on the bag of visual words paradigm. Evaluation of the visual grammar shows that a positive impact on classification accuracy and/or descriptor size is obtained when the technique are applied when the proposed techniques are applied.

研究动机与目标

  • 为解决视觉词袋(BoVW)模型在图像分类中的局限性,特别是其对词典大小的敏感性以及缺乏语义加权的问题。
  • 探究核心语言学文法特性——意义性、同义性与多义性——如何被适配至视觉领域,以改善图像表征。
  • 开发一种通用的、基于语言建模的框架,提升图像理解能力,同时不增加描述符的维度。
  • 在标准基准数据集上评估视觉语法变换对分类准确率与描述符尺寸的影响。

提出的方法

  • 视觉语法模型对标准BoVW实施三种变换:(1) 意义性过滤,以去除低效用的视觉词;(2) 同义性检测,用于将语义相似的视觉词分组;(3) 多义性量化,以识别具有歧义的视觉词。
  • 通过基于阈值的剪枝策略量化意义性,减少词典规模,同时保留判别能力。
  • 通过一组定义视觉词对之间关系的标准来建模同义性,实现特征融合或合并。
  • 将多义性识别并度量为一种歧义来源,从而在歧义情境下实现更鲁棒的表征。
  • 将余弦相似度度量扩展以整合全部三种变换,从而在视觉空间中实现更优的相似性计算。
  • 采用SIFT-based BoVW表示,在PASCAL VOC 2007与ImageCLEF 2013数据集上,使用1-NN分类器对方法进行评估。

实验结果

研究问题

  • RQ1语言学概念(如意义性、同义性与多义性)能否被有效适配以改善图像分类中的视觉表征?
  • RQ2这些受文法启发的变换在多大程度上可减少描述符尺寸而不牺牲分类准确率?
  • RQ3与Fisher向量等成熟方法相比,所提出的视觉语法模型在准确率与描述符长度方面表现如何?
  • RQ4在应用意义性过滤时,词典缩减与性能退化之间的最优平衡点是什么?
  • RQ5将视觉语法变换与余弦相似度结合,是否能带来优于基线BoVW的性能?

主要发现

  • 在使用余弦相似度结合视觉语法变换时,分类准确率获得稳定且统计显著的提升(p < 0.05),同时词典规模小幅缩减。
  • 无论采用何种相似度度量,即使在词典规模中等至大幅缩减的情况下,分类准确率仍与基线BoVW保持相当水平。
  • 当词典规模缩减超过初始大小的10–20%时,准确率出现显著下降,表明剪枝存在性能阈值。
  • 视觉语法模型在描述符尺寸显著小于Fisher向量的情况下,实现了与之相当的分类准确率,尤其在结合余弦相似度时表现更优。
  • 该方法成功降低了描述符维度,同时保持或提升了分类性能,证明其在紧凑视觉表征中的有效性。
  • 该框架能够识别跨类型特征关系,并通过语言学启发的过滤与分组,提供一种系统化降低BoVW维度的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。