[论文解读] When Naïve Bayes Nearest Neighbours Meet Convolutional Neural Networks
本文提出了一种框架,通过从预训练的卷积神经网络(CNN)中提取多尺度局部块特征,并应用一种可扩展的朴素贝叶斯非线性学习变体(sNBNL),将卷积神经网络(CNN)激活与朴素贝叶斯最近邻(NBNN)分类器相结合。该方法在场景识别和领域自适应基准上实现了最先进性能,表明结合CNN特征与可扩展训练方法后,NBNN-based方法可被有效复兴。
Since Convolutional Neural Networks (CNNs) have become the leading learning paradigm in visual recognition, Naive Bayes Nearest Neighbour (NBNN)-based classifiers have lost momentum in the community. This is because (1) such algorithms cannot use CNN activations as input features; (2) they cannot be used as final layer of CNN architectures for end-to-end training , and (3) they are generally not scalable and hence cannot handle big data. This paper proposes a framework that addresses all these issues, thus bringing back NBNNs on the map. We solve the first by extracting CNN activations from local patches at multiple scale levels, similarly to [1]. We address simultaneously the second and third by proposing a scalable version of Naive Bayes Non-linear Learning (NBNL, [2]). Results obtained using pre-trained CNNs on standard scene and domain adaptation databases show the strength of our approach, opening a new season for NBNNs.
研究动机与目标
- 为解决在深度学习时代,NBNN-based分类器无法利用CNN激活或扩展至大规模数据集的局限性。
- 通过在不使用池化或拼接的情况下,在多个尺度上提取局部块激活,使NBNN方法能够与CNN特征协同工作。
- 开发一种适用于NBNN-based模型的可扩展训练算法,在降低内存与计算成本的同时保持高预测性能。
- 证明当结合CNN特征与高效学习算法时,NBNN-based方法可实现最先进性能。
- 在标准的场景识别与领域自适应基准上验证该框架,展示其强大的泛化与迁移能力。
提出的方法
- 在多个尺度层级(32px、64px、128px)上从局部块中提取CNN激活特征,不使用池化或拼接,以保留局部结构供NBNN输入。
- 使用朴素贝叶斯非线性学习(sNBNL)的可扩展随机变体,以处理高达10^7个特征的大规模数据集,实现高效训练。
- 在sNBNL中应用潜在局部线性SVM框架,以建模非线性决策边界,同时保持NBNN的通用性。
- 采用sNBNL的平滑版本,理论上可作为CNN架构中的端到端可微分最终层。
- 使用基于Caffe的预训练CNN进行特征提取,并将该框架应用于场景分类与领域自适应任务。
- 在图像上实施密集块采样,并将所得多尺度特征作为NBNN-based分类器的输入。
实验结果
研究问题
- RQ1NBNN-based分类器能否有效结合CNN激活,以克服其在可扩展性与特征兼容性方面的历史局限?
- RQ2从预训练CNN中提取的多尺度局部块特征,能否在不使用池化或拼接的情况下,作为NBNN-based模型的有效输入?
- RQ3如sNBNL这样的NBNN可扩展变体,能否在大规模数据集上保持高预测性能,同时降低内存与计算成本?
- RQ4所提出的框架能否在标准的场景识别与领域自适应基准上实现最先进性能?
- RQ5该框架是否能在无需显式适应机制的零样本与少样本领域自适应场景中实现良好泛化?
主要发现
- 在Scene15、UIUC Sports与MIT Indoor数据集上,所提出的CNN-sNBNL框架在单特征方法中达到最先进性能,优于传统方法与NBNN-based方法。
- 在Office+Caltech256的无监督领域自适应设置中,CNN-sNBNL在C→A设置下达到80.91%的准确率,超越所有基线方法,包括学习型方法。
- 在半监督领域自适应设置中,CNN-sNBNL在C→A设置下达到85.62%的准确率,创下新最先进水平,甚至优于专门设计的领域自适应模型。
- 在半监督领域自适应的A→W设置中,该框架达到90.03%的准确率,表明其在极少量目标数据下仍具备强大泛化能力。
- 所提出的sNBNL算法可支持超过10^7个特征的数据集训练,使NBNN-based方法在大规模视觉识别任务中具备可行性。
- 该框架是首个成功将NBNN-based分类器与CNN特征相连接的方案,使NBNNs作为视觉识别中的竞争性范式得以复兴。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。