[论文解读] TDAPNet: Prototype Network with Recurrent Top-Down Attention for Robust Object Classification under Partial Occlusion
TDAPNet 提出了一种基于原型的网络,结合循环的自顶向下注意力机制,以提升在部分遮挡情况下的物体分类鲁棒性。通过结合原型学习、注意力引导的部分匹配以及自顶向下的反馈调节,该方法减少了遮挡污染并增强了特征泛化能力,在遮挡 MNIST 和 PASCAL3D+ 数据集上实现了显著的准确率提升。
Despite deep convolutional neural networks' great success in object classification, it suffers from severe generalization performance drop under occlusion due to the inconsistency between training and testing data. Because of the large variance of occluders, our goal is a model trained on occlusion-free data while generalizable to occlusion conditions. In this work, we integrate prototypes, partial matching and top-down attention regulation into deep neural networks to realize robust object classification under occlusion. We first introduce prototype learning as its regularization encourages compact data clusters, which enables better generalization ability under inconsistent conditions. Then, attention map at intermediate layer based on feature dictionary and activation scale is estimated for partial matching, which sifts irrelevant information out when comparing features with prototypes. Further, inspired by neuroscience research that reveals the important role of feedback connection for object recognition under occlusion, a top-down feedback attention regulation is introduced into convolution layers, purposefully reducing the contamination by occlusion during feature extraction stage. Our experiment results on partially occluded MNIST and vehicles from the PASCAL3D+ dataset demonstrate that the proposed network significantly improves the robustness of current deep neural networks under occlusion. Our code will be released.
研究动机与目标
- 解决深度卷积神经网络在部分遮挡下因干净训练数据与遮挡测试数据分布偏移而导致的泛化失败问题。
- 通过引入原型学习,鼓励紧凑的、类别特定的特征簇,以克服在训练数据上的过拟合。
- 利用自顶向下的注意力反馈机制,减轻特征提取过程中遮挡物带来的特征污染。
- 通过学习到的注意力图聚焦于未被遮挡的、信息丰富的部分,实现在遮挡条件下的有效原型匹配。
- 开发一种方法,使其能泛化到未见过的遮挡模式,且在训练过程中无需使用遮挡数据。
提出的方法
- 在特征提取后采用原型学习,以正则化特征簇,并提升在分布偏移下的泛化能力。
- 利用激活尺度和学习到的特征词典,在 pool-4 层估计注意力图,以识别信息丰富且未被遮挡的物体部分。
- 分两个阶段应用注意力图:首先用于自顶向下的反馈调节,以抑制低层中的遮挡引起的异常;然后用于部分匹配,以过滤被遮挡的特征。
- 引入循环的自顶向下注意力机制,将高层语义信息传播至低层,以减少早期卷积层中的特征污染。
- 使用特征与原型之间的欧氏距离进行分类,但仅在注意力引导的特征选择和自顶向下优化之后进行。
- 在无遮挡数据上端到端训练网络,训练过程中无需进行遮挡增强。
实验结果
研究问题
- RQ1在训练过程中无需遮挡数据的情况下,原型学习是否能提升深度网络在部分遮挡下的泛化能力?
- RQ2注意力机制如何用于聚焦于未被遮挡的、信息丰富的物体部分,以实现在遮挡条件下的有效部分匹配?
- RQ3自顶向下的反馈注意力在多大程度上能减少早期卷积层中由遮挡引起的特征污染?
- RQ4原型学习、基于注意力的部分匹配与自顶向下调节的集成是否能在遮挡物体分类基准上带来显著的性能提升?
- RQ5每个类别使用多个原型在多大程度上增强了模型对遮挡下物体外观空间差异的捕捉能力?
主要发现
- 与基线模型相比,TDAPNet 在部分遮挡的 MNIST 和 PASCAL3D+ 数据集上显著提升了分类准确率,证明了其在未见遮挡模式下的鲁棒性。
- 使用多个原型(每类 4 个)优于单个原型,表明多个原型能更好地捕捉因视角变化引起的空间差异。
- 基于激活尺度和特征词典估计的注意力图能有效减少对遮挡物的关注,增强对物体部分的关注,从而提升部分匹配性能。
- 通过一次自顶向下传播,池化层 4(pool-4)中的遮挡引起的特征差异减少了高达 80%(以激活差异减少衡量),证实了其在抑制污染方面的有效性。
- 经过一次自顶向下传播后的最终注意力图,对信息丰富且未被遮挡的区域表现出最精细的聚焦,对遮挡物和背景的注意力最小。
- 该模型在训练过程中未使用任何遮挡数据,仍实现了优异性能,证明了其对未见遮挡模式的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。