Skip to main content
QUICK REVIEW

[论文解读] DAS: A Deformable Attention to Capture Salient Information in CNNs

Farzad Salajegheh, Nader Asadi|arXiv (Cornell University)|Nov 20, 2023
Advanced Neural Network Applications被引用 7
一句话总结

DAS 提出了一种轻量级、全卷积的注意力机制,通过结合可变形卷积实现空间聚焦和深度可分离卷积实现效率,将计算复杂度降至 O(n)。该方法通过聚焦显著特征,提升了图像分类和目标检测任务的性能,在极低的 FLOP 增加和无需修改主干网络的前提下,实现了最先进结果。

ABSTRACT

Convolutional Neural Networks (CNNs) excel in local spatial pattern recognition. For many vision tasks, such as object recognition and segmentation, salient information is also present outside CNN's kernel boundaries. However, CNNs struggle in capturing such relevant information due to their confined receptive fields. Self-attention can improve a model's access to global information but increases computational overhead. We present a fast and simple fully convolutional method called DAS that helps focus attention on relevant information. It uses deformable convolutions for the location of pertinent image regions and separable convolutions for efficiency. DAS plugs into existing CNNs and propagates relevant information using a gating mechanism. Compared to the O(n^2) computational complexity of transformer-style attention, DAS is O(n). Our claim is that DAS's ability to pay increased attention to relevant features results in performance improvements when added to popular CNNs for Image Classification and Object Detection. For example, DAS yields an improvement on Stanford Dogs (4.47%), ImageNet (1.91%), and COCO AP (3.3%) with base ResNet50 backbone. This outperforms other CNN attention mechanisms while using similar or less FLOPs. Our code will be publicly available.

研究动机与目标

  • 解决 CNN 在捕捉固定卷积核感受野之外显著信息方面的局限性。
  • 在不增加计算复杂度(如 Transformer)的前提下,为 CNN 提供密集、整体的注意力机制。
  • 开发一种即插即用的注意力模块,通过极少的架构修改增强现有 CNN。
  • 通过可变形卷积和门控机制聚焦任务相关区域,改善特征表示。
  • 通过新型显著特征检测(sfd)指标,评估注意力聚焦的有效性。

提出的方法

  • DAS 集成了一种门控机制,将主干网络的特征图与可变形卷积的输出相结合,以突出显著区域。
  • 采用深度可分离卷积,高效建模全局上下文,同时保持低 FLOP 成本。
  • 可变形卷积动态调整采样位置,聚焦于相关图像区域,提升空间注意力。
  • 该方法仅使用一个可学习的超参数 α 来控制注意力门的强度,便于调优。
  • 注意力门插入在每个残差块之后,实现在早期阶段和持续过程中对显著特征的关注。
  • 该架构为全卷积结构,兼容任何现有 CNN 主干网络,无需修改原始网络。

实验结果

研究问题

  • RQ1轻量级、基于卷积的注意力机制是否能在不增加计算复杂度的前提下,改善 CNN 的特征表示?
  • RQ2结合可变形卷积和深度可分离卷积是否能实现更有效且高效的显著图像区域注意力?
  • RQ3在标准视觉基准上,DAS 与现有 CNN 注意力机制相比,在性能和 FLOP 效率方面表现如何?
  • RQ4通过 gradCAM 和 sfd 指标衡量,DAS 在多大程度上增强了对任务相关特征的注意力聚焦?
  • RQ5DAS 是否能有效应用于图像分类和目标检测任务,并实现一致的性能提升?

主要发现

  • 当添加到 ResNet-50 时,DAS 在 Stanford Dogs 数据集上将 top-1 准确率提升 4.47%,在 ImageNet 上提升 1.91%。
  • 在 COCO 目标检测任务中,DAS 相较于基础的 ResNet-50 主干网络,实现 3.3% 的 AP 提升。
  • 显著特征检测(sfd)得分从标准 ResNet-50 的 0.59 提升至 DAS 的 0.72,表明对相关特征的关注更强。
  • 在 100 张 ImageNet 图像的随机样本中,DAS 的平均 sfd 得分为 0.68,而标准 ResNet 的得分为 0.47。
  • gradCAM 可视化显示,与基线 ResNet 相比,DAS 在更深的块(如第 4 个块)中更有效地将注意力集中在相关区域。
  • DAS 保持 O(n) 复杂度,显著优于具有 O(n²) 复杂度的 Transformer 式注意力机制,同时使用相似或更少的 FLOPs。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。