Skip to main content
QUICK REVIEW

[论文解读] NAM: Normalization-based Attention Module

Yichao Liu, Zongru Shao|arXiv (Cornell University)|Nov 24, 2021
Advanced Neural Network Applications参考文献 10被引用 7
一句话总结

本文提出NAM(基于归一化的注意力模块),一种轻量级注意力机制,通过利用批量归一化缩放因子来抑制不显著特征,从而提升模型效率。通过在这些缩放因子上施加$l_1$正则化,NAM在ResNet和MobileNet上实现了与SE、BAM、CBAM和TAM相当的FLOPs和参数量下更高的准确率。

ABSTRACT

Recognizing less salient features is the key for model compression. However, it has not been investigated in the revolutionary attention mechanisms. In this work, we propose a novel normalization-based attention module (NAM), which suppresses less salient weights. It applies a weight sparsity penalty to the attention modules, thus, making them more computational efficient while retaining similar performance. A comparison with three other attention mechanisms on both Resnet and Mobilenet indicates that our method results in higher accuracy. Code for this paper can be publicly accessed at https://github.com/Christian-lyc/NAM.

研究动机与目标

  • 解决现有注意力机制中未充分考虑权重贡献因素的问题。
  • 通过抑制不显著的通道和空间特征,在不增加额外层的情况下提升模型效率。
  • 开发一种轻量级注意力模块,在计算开销极小的情况下保持高性能。
  • 探索利用批量归一化统计量作为注意力机制中特征重要性的代理。

提出的方法

  • NAM使用批量归一化中的缩放因子$\gamma$作为通道重要性的度量,替代SE和CBAM中使用的MLP。
  • 通道注意力子模块将注意力权重计算为$W_{\gamma} = \gamma_i / \sum_j \gamma_j$,在通道维度上进行归一化。
  • 空间注意力子模块采用相同原理,利用空间批量归一化评估像素级重要性,通过$\lambda$实现。
  • 在损失函数中对$\gamma$和$\lambda$施加$l_1$范数正则化,以鼓励稀疏性并抑制不显著权重。
  • 该模块被集成到残差块中,遵循CBAM的顺序设计,实现通道与空间注意力的顺序作用。
  • 该方法避免了额外的全连接层或卷积层,相比SE和CBAM显著减少了参数量和FLOPs。

实验结果

研究问题

  • RQ1批量归一化缩放因子能否有效用于识别并抑制注意力机制中的不显著特征?
  • RQ2与SE、BAM、CBAM和TAM等现有注意力模块相比,NAM在准确率和效率方面表现如何?
  • RQ3对缩放因子$\gamma$和$\lambda$施加$l_1$正则化,对提升模型稀疏性和性能有何影响?
  • RQ4NAM是否能在ResNet和MobileNet等深度和轻量级网络上,在降低模型复杂度的同时保持高性能?
  • RQ5不同的集成策略(仅通道、仅空间或联合使用)如何影响NAM的最终准确率和效率?

主要发现

  • 在CIFAR-100上,仅使用通道注意力的NAM(NAM(ch*))达到19.09%的top-1错误率,优于SE(20.29%)、BAM(19.97%)、CBAM(19.44%)和TAM(20.15%)。
  • 在CIFAR-100上,仅使用空间注意力的NAM(NAM(sp*))达到19.38%的top-1错误率,优于SE、BAM和TAM,但略低于仅通道变体。
  • 在ImageNet上,NAM与MobileNet V2结合时达到29.34%的top-1错误率,优于SE(29.77%)、BAM(29.91%)和CBAM(29.74%),且FLOPs和参数量几乎相同。
  • NAM仅增加极少量参数(3.51M vs. CBAM的3.54M),同时实现更高准确率,证明了其高效性。
  • $l_1$正则化对$\gamma$和$\lambda$的成功应用,有效诱导了不显著权重的稀疏性,从而提升了泛化能力和效率。
  • 消融实验证实,将BN缩放因子用作注意力权重既有效又计算高效,避免了对额外MLP或卷积层的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。