Skip to main content
QUICK REVIEW

[论文解读] Learning Chained Deep Features and Classifiers for Cascade in Object Detection

Wanli Ouyang, Ku Wang|arXiv (Cornell University)|Feb 23, 2017
Advanced Image and Video Retrieval Techniques参考文献 26被引用 20
一句话总结

本文提出链式级联网络(CC-Net),一种端到端的深度学习框架,通过分类器与特征的级联连接,联合学习级联分类器和特征,以提升目标检测的准确率与效率。通过利用前序阶段的分类分数与特征作为先验知识,CC-Net在PASCAL VOC 2007上实现了81.1%的mAP,达到当前最先进水平。

ABSTRACT

Cascade is a widely used approach that rejects obvious negative samples at early stages for learning better classifier and faster inference. This paper presents chained cascade network (CC-Net). In this CC-Net, the cascaded classifier at a stage is aided by the classification scores in previous stages. Feature chaining is further proposed so that the feature learning for the current cascade stage uses the features in previous stages as the prior information. The chained ConvNet features and classifiers of multiple stages are jointly learned in an end-to-end network. In this way, features and classifiers at latter stages handle more difficult samples with the help of features and classifiers in previous stages. It yields consistent boost in detection performance on benchmarks like PASCAL VOC 2007 and ImageNet. Combined with better region proposal, CC-Net leads to state-of-the-art result of 81.1% mAP on PASCAL VOC 2007.

研究动机与目标

  • 通过端到端深度网络改进级联学习,以缓解目标检测中前景与背景样本的不平衡问题。
  • 克服标准级联方法中丢弃早期阶段分类分数与特征的局限性。
  • 利用前序阶段的先验知识,联合优化级联阶段中的分类器与特征学习。
  • 通过在统一深度网络中引入分类器级联与特征级联,提升检测性能。

提出的方法

  • 提出分类器级联,即利用前序级联阶段的分类分数作为当前阶段分类器的先验知识。
  • 提出特征级联,即利用早期阶段的特征引导后续阶段的特征学习,以聚焦互补的视觉线索。
  • 设计单一端到端的卷积神经网络,通过共享损失函数,联合学习级联分类器与链式特征。
  • 采用可学习的缩放向量a和b控制特征与分数的融合,提升模型鲁棒性与性能。
  • 以多上下文与多分辨率特征作为输入,全局池化特征作为基础表征。
  • 应用在线难例挖掘(OHEM)与区域提议(如Craft+)以提升训练效率与召回率。

实验结果

研究问题

  • RQ1在深度级联网络中,通过前序阶段的置信度分数指导后续阶段决策的分类器级联,是否能提升检测准确率?
  • RQ2通过将早期阶段的特征作为先验知识,特征级联是否能增强后续阶段的特征学习?
  • RQ3在统一深度网络中联合端到端训练链式分类器与特征,是否能超越标准级联或非链式方法?
  • RQ4在单一深度网络中结合分类器级联与特征级联,能带来多大性能增益?
  • RQ5可学习的缩放向量与网络结构设计选择对mAP与检测鲁棒性有何影响?

主要发现

  • CC-Net在PASCAL VOC 2007上达到81.1%的mAP,创下该基准的新SOTA结果。
  • 仅使用分类器级联,相较于基线BN-Inception,在四阶段级联设置下mAP提升1.5%。
  • 在ImageNet上,结合分类器级联与特征级联的模型相比非链式基线,mAP提升3.2%。
  • 从CC-Net中移除分类器级联后,mAP下降0.8%,证明其有效性。
  • 可学习的缩放向量a和b贡献显著,若将其固定为1.0,mAP将下降1.7%。
  • 使用每张图像300个区域提议(来自Craft+)的CC-Net即可实现高性能,无需增加提议数量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。