Skip to main content
QUICK REVIEW

[论文解读] E$^2$BoWs: An End-to-End Bag-of-Words Model via Deep Convolutional Neural Network

Xiaobin Liu, Shiliang Zhang|arXiv (Cornell University)|Sep 18, 2017
Advanced Image and Video Retrieval Techniques参考文献 29被引用 3
一句话总结

本文提出E²BoWs,一种基于深度卷积神经网络的端到端词袋模型,用于生成语义区分性强的视觉词。通过用卷积层替代GoogLeNet的最后全连接层以生成类别特定的语义特征图,并引入一种具有稀疏正则化的新型词袋层,该模型在大规模图像检索中实现了最先进水平的准确率与效率,在CIFAR-10、CIFAR-100、MIRFLICKR-25K和NUS-WIDE数据集上均优于传统BoW方法和近期的深度学习基线模型。

ABSTRACT

Traditional Bag-of-visual Words (BoWs) model is commonly generated with many steps including local feature extraction, codebook generation, and feature quantization, etc. Those steps are relatively independent with each other and are hard to be jointly optimized. Moreover, the dependency on hand-crafted local feature makes BoWs model not effective in conveying high-level semantics. These issues largely hinder the performance of BoWs model in large-scale image applications. To conquer these issues, we propose an End-to-End BoWs (E$^2$BoWs) model based on Deep Convolutional Neural Network (DCNN). Our model takes an image as input, then identifies and separates the semantic objects in it, and finally outputs the visual words with high semantic discriminative power. Specifically, our model firstly generates Semantic Feature Maps (SFMs) corresponding to different object categories through convolutional layers, then introduces Bag-of-Words Layers (BoWL) to generate visual words for each individual feature map. We also introduce a novel learning algorithm to reinforce the sparsity of the generated E$^2$BoWs model, which further ensures the time and memory efficiency. We evaluate the proposed E$^2$BoWs model on several image search datasets including CIFAR-10, CIFAR-100, MIRFLICKR-25K and NUS-WIDE. Experimental results show that our method achieves promising accuracy and efficiency compared with recent deep learning based retrieval works.

研究动机与目标

  • 为克服依赖手工设计局部特征和多阶段处理的传统词袋(BoW)模型的局限性。
  • 通过将深度卷积神经网络(DCNN)整合到BoW框架中,以实现更好的语义表示,弥合图像检索中的语义鸿沟。
  • 实现BoW模型的端到端训练,联合优化特征学习与视觉词生成。
  • 确保生成的视觉词表示具有高效率和稀疏性,以支持可扩展的倒排文件索引与快速检索。
  • 在现有基于深度学习的检索方法基础上,提升泛化能力与区分能力,尤其在语义相似性搜索方面。

提出的方法

  • 将GoogLeNet的最后全连接层替换为卷积层,以生成对应n个物体类别的n个语义特征图(SFMs)。
  • 每个语义特征图通过一种新型词袋层(BoWL)处理,每幅图生成m个稀疏视觉词,总计产生m×n个视觉词。
  • 应用阈值化机制以强制实现视觉词表示的稀疏性,提升内存与计算效率。
  • 引入三元损失函数:(1) 分类损失用于训练,(2) 对比损失以促使相似图像共享更多视觉词,(3) 稀疏正则化损失以维持每张图像的视觉词数量较低。
  • 通过反向传播进行端到端训练,实现特征提取、视觉词生成与稀疏性的联合优化。
  • 该框架支持倒排文件索引与TF-IDF加权,实现高效的规模化图像检索。

实验结果

研究问题

  • RQ1能否使用深度卷积神经网络端到端生成视觉词,从而替代传统的多阶段BoW流水线?
  • RQ2用深度特征替代手工设计的局部特征是否能提升图像检索中的语义区分能力?
  • RQ3具有稀疏正则化的新型词袋层是否能在提升准确率的同时保持高检索效率?
  • RQ4与标准深度特征(如GoogLeNet)相比,所提出的E²BoWs模型在多样化数据集上的泛化能力如何?
  • RQ5在使用学习得到的视觉词与二值码时,检索准确率与计算效率之间的权衡如何?

主要发现

  • 在CIFAR-10上,E²BoWs-B(二值化版本)的平均平均精度(mAP)达到0.563,优于最佳基线BHC [23]的mAP 0.543。
  • 在NUS-WIDE上,E²BoWs模型的mAP达到0.599,显著优于GoogLeNet特征(最佳基线mAP 0.594),并展现出更优的泛化能力。
  • 在MIRFLICKR-25K上,每张图像的平均视觉词数量仅为43.6,表明具有高度稀疏性与效率,远低于BHC中二值码所需的480,000次运算。
  • 通过利用倒排文件索引,该模型将检索复杂度降低,CIFAR-10上每张图像仅需8.64次运算,远低于使用二值码的线性搜索所需8,294次运算。
  • 所提出的三元损失函数可实现更快收敛,并在所有基准数据集上验证了其在语义区分能力与稀疏性方面的提升。
  • E²BoWs生成的视觉词表示展现出更强的语义线索——例如在眼图中正确识别出'people'——表明其在语义理解方面优于BHC [23]。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。