Skip to main content
QUICK REVIEW

[论文解读] Deep Discriminative Representation Learning with Attention Map for Scene Classification

Jun Li, Daoyu Lin|arXiv (Cornell University)|Feb 21, 2019
Advanced Image and Video Retrieval Techniques参考文献 49被引用 4
一句话总结

本文提出DDRL-AM,一种用于遥感场景分类的深度判别表示学习框架,通过将类别激活图(CAMs)作为注意力引导,并结合交叉熵损失与中心损失以提升特征判别性。通过在双流卷积神经网络架构中融合RGB特征与注意力图,并采用中心损失进行优化,该方法在NWPU-RESISC45和UC-Merced数据集上实现了最先进性能,17个类别达到100%准确率,且在宫殿和铁路车站等困难类别上取得显著提升。

ABSTRACT

Learning powerful discriminative features for remote sensing image scene classification is a challenging computer vision problem. In the past, most classification approaches were based on handcrafted features. However, most recent approaches to remote sensing scene classification are based on Convolutional Neural Networks (CNNs). The de facto practice when learning these CNN models is only to use original RGB patches as input with training performed on large amounts of labeled data (ImageNet). In this paper, we show class activation map (CAM) encoded CNN models, codenamed DDRL-AM, trained using original RGB patches and attention map based class information provide complementary information to the standard RGB deep models. To the best of our knowledge, we are the first to investigate attention information encoded CNNs. Additionally, to enhance the discriminability, we further employ a recently developed object function called "center loss," which has proved to be very useful in face recognition. Finally, our framework provides attention guidance to the model in an end-to-end fashion. Extensive experiments on two benchmark datasets show that our approach matches or exceeds the performance of other methods.

研究动机与目标

  • 解决遥感图像场景分类中类内差异大、类间差异小以及小目标检测困难的挑战。
  • 通过引入预训练模型生成的注意力图,突出场景图像中的显著区域,提升特征判别性。
  • 通过在训练过程中整合中心损失与标准交叉熵损失,增强模型泛化能力与类别可分性。
  • 构建一个端到端可训练的框架,利用注意力图作为指导,以判别性方式优化特征学习。
  • 验证基于注意力的特征引导与中心损失在减少误分类,特别是视觉相似或小目标(如高尔夫球场和飞机)方面的有效性。

提出的方法

  • 构建双流卷积神经网络架构:一个分支处理原始RGB图像块,另一个分支处理通过Grad-CAM从预训练模型生成的类别激活图(CAMs)。
  • 在特征图层面融合RGB特征与CAM特征,实现注意力引导的表示学习。
  • 使用组合损失函数进行模型训练:标准交叉熵损失用于分类任务,中心损失用于拉近嵌入空间中同类样本的特征距离。
  • 利用中心损失强制实现类内紧凑性,降低类内差异,提升类间可分性。
  • 采用端到端训练,联合优化注意力图生成与特征学习过程。
  • 利用t-SNE可视化分析高维特征空间,验证所学表征的聚类行为。

实验结果

研究问题

  • RQ1从预训练模型中提取的注意力图能否为遥感场景分类提供有意义的空间指导?
  • RQ2将中心损失与交叉熵损失结合是否能提升遥感图像分类中的特征判别性?
  • RQ3注意力图的集成在多大程度上提升了模型对视觉相似类别(如高速公路、铁路和跑道)的区分能力?
  • RQ4与标准CNN及现有度量学习方法相比,所提出的DDRL-AM框架在多大程度上降低了误分类率?
  • RQ5基于注意力的特征学习是否能提升对小目标或模糊目标(如高尔夫球场和飞机)的分类性能?

主要发现

  • 所提出的DDRL-AM方法在NWPU-RESISC45数据集的45个类别中,有17个类别达到100%分类准确率,展现出强大的判别能力。
  • 该方法将宫殿类和铁路车站类的分类准确率分别提升了0.12和0.14,有效减少了因类内差异导致的误分类。
  • 在NWPU-RESISC45和UC-Merced数据集上的混淆矩阵显示结构更清晰,误分类显著减少,尤其在视觉相似类别之间。
  • t-SNE可视化结果表明,中心损失使类内特征聚类更紧密,类间特征在嵌入空间中分离更明显。
  • 注意力图与中心损失的融合使特征空间更具鲁棒性与判别性,所有评估指标均显示性能提升。
  • 该方法在两个基准数据集上均优于现有最先进方法,证实其在解决遥感场景分类关键挑战方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。