Skip to main content
QUICK REVIEW

[论文解读] Growing Interpretable Part Graphs on ConvNets via Multi-Shot Learning

Quanshi Zhang, Ruiming Cao|arXiv (Cornell University)|Nov 14, 2016
Advanced Neural Network Applications参考文献 34被引用 10
一句话总结

该论文提出了一种少样本学习方法,通过仅使用3–12个部件标注,从特征图中挖掘可靠的潜在模式,在预训练的ConvNets上构建可解释的部件图。该方法构建了一个分层的与-或图(AOG),将CNN单元与语义部件关联,相较于基线方法,在PASCAL VOC和ImageNet数据集上实现了13%–107%的部件中心定位性能提升。

ABSTRACT

This paper proposes a learning strategy that extracts object-part concepts from a pre-trained convolutional neural network (CNN), in an attempt to 1) explore explicit semantics hidden in CNN units and 2) gradually grow a semantically interpretable graphical model on the pre-trained CNN for hierarchical object understanding. Given part annotations on very few (e.g., 3-12) objects, our method mines certain latent patterns from the pre-trained CNN and associates them with different semantic parts. We use a four-layer And-Or graph to organize the mined latent patterns, so as to clarify their internal semantic hierarchy. Our method is guided by a small number of part annotations, and it achieves superior performance (about 13%-107% improvement) in part center prediction on the PASCAL VOC and ImageNet datasets.

研究动机与目标

  • 在不微调的情况下从预训练的CNN中提取显式的语义概念,以解释黑箱表示。
  • 通过利用CNN特征图中的隐式模式,实现少样本学习以进行部件定位。
  • 构建一个分层的、可解释的图模型(与-或图),以捕捉语义部件结构及空间关系。
  • 通过仅使用每类3–12个标注样本逐步构建新的语义图,减少对大规模标注的依赖。
  • 为机器人操作等现实应用场景实现在线学习,以应对时间与数据受限的挑战。

提出的方法

  • 通过识别在标注图像中一致表示子部件或上下文区域的CNN单元,从预训练的CNN特征图中挖掘可靠的潜在模式。
  • 定义一个四层与-或图(AOG),其中或节点表示部件模板的替代选项,与节点表示部件的分解,第三层的或节点编码子部件或上下文,终端节点为CNN单元。
  • 使用基于激活一致性、空间稳定性和共现频率的度量方法,以区分可靠潜在模式与噪声。
  • 通过响应强度、与理想位置的空间形变,以及与高层模式的成对空间兼容性,制定终端节点的推理得分。
  • 从真实部件标注中估计关键AOG参数,如理想位置($\overline{\bf P}_{V^{\textrm{lat}}}$)和位移($\Delta{\bf P}_{V^{\textrm{lat}}}$)。
  • 执行分层推理:首先推理高层潜在模式,然后利用学习到的空间和响应约束,引导低层单元的选择。

实验结果

研究问题

  • RQ1我们能否仅使用少量部件标注,从预训练的CNN中提取可解释的语义部件结构?
  • RQ2我们如何识别对应于有意义子部件或上下文的CNN特征图中的可靠潜在模式?
  • RQ3能否在不微调的情况下,对预训练的CNN逐步构建分层的与-或图,以建模语义部件层次结构?
  • RQ4何种评分机制可实现在最小监督下的准确且鲁棒的部件定位?
  • RQ5与端到端微调或基线检测方法相比,该方法在部件定位性能上的提升程度如何?

主要发现

  • 与基线方法相比,该方法在PASCAL VOC和ImageNet数据集上的部件中心定位准确率提升了13%–107%。
  • 该方法成功利用学习到的AOG重建了物体部件(如狗头),展示了良好的可解释性与结构保真度。
  • AOG构建对形变和空间变化具有鲁棒性,如在不同姿态和外观下均表现出稳定性能。
  • 该方法在未标注图像上泛化良好,挖掘出的潜在模式在同类别未标注实例中频繁出现。
  • 利用响应强度、空间形变和成对兼容性得分,即使在极少数监督下也能实现准确的定位。
  • 该方法可实现新部件的在线学习,仅需一个标注样本,显著降低了现实场景中的标注成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。