Skip to main content
QUICK REVIEW

[论文解读] Multi-label Object Attribute Classification using a Convolutional Neural Network

Soubarna Banik, Mikko Lauri|arXiv (Cornell University)|Nov 10, 2018
Advanced Image and Video Retrieval Techniques参考文献 15被引用 8
一句话总结

本文提出深度属性网络(DAN),一种微调的卷积神经网络,通过迁移学习和端到端微调,将预训练的目标识别模型适配用于低层次对象属性的多标签分类——颜色、形状、图案和纹理。通过联合学习这些属性,DAN在ImageNet Attribute和a-Pascal数据集上实现了最先进性能,ROC-AUC分数相比先前方法最高提升21%。

ABSTRACT

Objects of different classes can be described using a limited number of attributes such as color, shape, pattern, and texture. Learning to detect object attributes instead of only detecting objects can be helpful in dealing with a priori unknown objects. With this inspiration, a deep convolutional neural network for low-level object attribute classification, called the Deep Attribute Network (DAN), is proposed. Since object features are implicitly learned by object recognition networks, one such existing network is modified and fine-tuned for developing DAN. The performance of DAN is evaluated on the ImageNet Attribute and a-Pascal datasets. Experiments show that in comparison with state-of-the-art methods, the proposed model achieves better results.

研究动机与目标

  • 开发一种深度学习模型,用于学习通用的低层次对象属性(颜色、形状、图案、纹理),以提升对象描述与识别能力。
  • 通过利用预训练卷积神经网络的特征,解决先前方法依赖手工设计特征或仅关注高层次属性的局限性。
  • 通过跨属性的联合特征学习,实现多标签属性分类,提升泛化能力与性能表现。
  • 探索通过反向传播生成的特定属性注意力图在杂乱或未知环境中实现对象定位的可行性。

提出的方法

  • 使用迁移学习,对预训练的目标识别卷积神经网络(VGG-16)进行微调,以实现属性分类。
  • 通过修改最后几层网络结构,将网络架构适配为多任务学习,实现多标签分类,且不强制施加显式的属性相关性。
  • 采用端到端训练,同时使用交叉熵损失函数优化所有属性,实现低层次视觉模式之间的共享特征学习。
  • 采用激励反向传播(Excitation Backpropagation)生成用于属性定位的注意力图,利用属性标签作为反馈信号。
  • 在ImageNet Attribute数据集上进行训练,并在ImageNet和a-Pascal数据集上进行评估,使用标准指标如ROC-AUC和mAP。
  • 仅在基线比较中排除模糊标签;在DAN中保留这些标签以避免数据偏差,采用公平的评估协议。

实验结果

研究问题

  • RQ1预训练的目标识别卷积神经网络能否被有效微调,用于低层次对象属性的多标签分类?
  • RQ2与独立分类或基于手工特征的方法相比,联合学习颜色、形状、图案和纹理属性是否能提升性能?
  • RQ3在基准数据集上,基于通用低层次属性训练的深度学习模型性能与最先进方法相比如何?
  • RQ4通过反向传播生成的特定属性注意力图能否用于图像中对象的定位?

主要发现

  • 在ImageNet Attribute数据集上,DAN在所有属性组的ROC-AUC分数上相比Russakovsky等人[16]和VGG-16+SVM高出3%至18%。
  • DAN-ResNet变体在纹理属性上达到0.91的ROC-AUC,形状属性为0.87,颜色属性为0.90,图案属性为0.82,显著优于先前方法。
  • 当包含全部25个属性时,DAN的mAP分数达到颜色0.75、形状0.66、图案0.53、纹理0.82,表现出强大的泛化能力。
  • 模型在20种和25种属性评估中均表现出一致性能,证实了该方法的鲁棒性与有效性。
  • 通过激励反向传播生成的注意力图能成功利用属性线索实现对象定位,例如在部分遮挡情况下仍能检测到红色碗。
  • 结果表明,微调网络学习到的特征比手工特征或标准对象网络的特征提取方法更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。