[论文解读] DCANet: Learning Connected Attentions for Convolutional Neural Networks
DCANet 引入了一种新颖的注意力机制,通过在卷积神经网络中连接相邻的注意力模块,实现模块间的特征信息流动,显著提升了注意力学习能力,且无需修改网络架构。通过跨注意力连接联合训练注意力模块,DCANet 在 ImageNet 和 MS COCO 上实现了最先进性能,计算开销极低,始终优于现有的注意力模块。
While self-attention mechanism has shown promising results for many vision tasks, it only considers the current features at a time. We show that such a manner cannot take full advantage of the attention mechanism. In this paper, we present Deep Connected Attention Network (DCANet), a novel design that boosts attention modules in a CNN model without any modification of the internal structure. To achieve this, we interconnect adjacent attention blocks, making information flow among attention blocks possible. With DCANet, all attention blocks in a CNN model are trained jointly, which improves the ability of attention learning. Our DCANet is generic. It is not limited to a specific attention module or base network architecture. Experimental results on ImageNet and MS COCO benchmarks show that DCANet consistently outperforms the state-of-the-art attention modules with a minimal additional computational overhead in all test cases. All code and models are made publicly available.
研究动机与目标
- 为解决现有自注意力机制各自独立处理每个注意力模块的局限性,忽略模块间的协作。
- 通过专用连接实现相邻注意力模块间的特征信息流动,提升注意力学习能力。
- 开发一种通用的、与网络架构无关的方法,增强各类注意力模块(如 SENet、CBAM、GCNet)而无需修改其内部结构。
- 在多个基准测试中展示一致的性能提升,包括 ImageNet 图像分类和 MS COCO 目标检测。
- 验证注意力连接与残差捷径不同,能主动引导注意力学习并提升特征判别能力。
提出的方法
- 在相邻注意力模块之间引入链式连接,使每个模块既能关注当前特征图,也能关注前一个注意力图。
- 提出一种可微的注意力连接机制,通过可学习权重将当前特征图与前一个注意力图融合。
- 采用类似残差连接的结构,但与 ResNet 的捷径不同,其传递的是注意力引导信号而非特征图。
- 使用可学习门控机制控制前序注意力的贡献比例,定义为 β/(α+β),实现自适应融合。
- 将该方法通用化应用于多种注意力模块(SENet、CBAM、GCNet、SKNet)和主干网络(ResNet、MobileNet、DenseNet),无需修改网络结构。
- 通过端到端反向传播联合训练所有注意力模块,实现网络内各模块的协同学习。
实验结果
研究问题
- RQ1模块间的注意力通信能否提升 CNN 中自注意力机制的表征能力?
- RQ2连接注意力模块是否能相比独立的注意力模块带来更好的特征判别性和注意力聚焦?
- RQ3能否设计一种通用的即插即用模块,在不修改架构的前提下增强多样化的注意力机制和主干网络?
- RQ4前序注意力图在不同层和模块中的贡献比例如何影响当前注意力学习?
- RQ5所提出的注意力连接机制是否能在图像分类和目标检测等不同视觉任务中实现良好泛化?
主要发现
- 在 ImageNet 上,DCANet 将 SE-MobileNetV2 的 Top-1 准确率提升 1.19%,参数量和 FLOPs 增加可忽略不计。
- 在 MS COCO 检测任务中,DCA-SE-ResNet50 在 RetinaNet 上实现 +0.3% AP 50:95 的提升,DCA-GC-ResNet50 在 Cascade R-CNN 上实现 +0.3% AP 50:95 的提升。
- DCANet 中的注意力图分布更加均匀,且远离 0.5 的聚集点,表明其注意力判别能力相比原始的 SE-ResNet50 显著提升。
- 所有连接中前序注意力图的贡献比例始终高于 0,证实先前注意力始终在引导当前注意力学习。
- 在 ResNet50 的 Stage 3 中,贡献比例趋于稳定,表明 DCANet 对深层特征学习的增强效果最为显著。
- 可视化结果表明,DCA 增强的模型能逐步聚焦于目标物体,而原始模型的注意力则在各阶段间随机跳变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。