Skip to main content
QUICK REVIEW

[论文解读] Switchable Self-attention Module

Shanshan Zhong, Wushao Wen|arXiv (Cornell University)|Sep 13, 2022
Advanced Neural Network Applications被引用 4
一句话总结

该论文提出了一种可切换激励模块(SEM),该模块基于输入特征动态选择并整合多种注意力算子(例如,FC、CNN、IE),以提升卷积神经网络中的通道级特征重校准。SEM在CIFAR-10和CIFAR-100上实现了最先进性能,相较于ResNet362,Top-1准确率最高提升达7.31%,展现出在不同网络深度和场景下卓越的自适应性与泛化能力。

ABSTRACT

Attention mechanism has gained great success in vision recognition. Many works are devoted to improving the effectiveness of attention mechanism, which finely design the structure of the attention operator. These works need lots of experiments to pick out the optimal settings when scenarios change, which consumes a lot of time and computational resources. In addition, a neural network often contains many network layers, and most studies often use the same attention module to enhance different network layers, which hinders the further improvement of the performance of the self-attention mechanism. To address the above problems, we propose a self-attention module SEM. Based on the input information of the attention module and alternative attention operators, SEM can automatically decide to select and integrate attention operators to compute attention maps. The effectiveness of SEM is demonstrated by extensive experiments on widely used benchmark datasets and popular self-attention networks.

研究动机与目标

  • 解决在所有网络层中使用单一固定注意力算子的局限性,该局限性会妨碍在不同场景下实现最优性能。
  • 克服手动搜索不同网络深度和数据集下最优注意力配置所导致的高计算成本和耗时问题。
  • 基于输入依赖的准则,实现对多种激励算子(例如,FC、ECA、IE)的自动、动态选择与整合,以增强特征重校准。
  • 通过引入可学习的切换机制作为正则化器,提升模型泛化能力并减少过拟合。
  • 在标准视觉基准上,于深度和浅层主干网络(从ResNet47到ResNet362)中均实现一致的性能提升。

提出的方法

  • 设计一种可切换激励模块(SEM),接收输入特征图,并并行应用一组预定义的激励算子(例如,全连接、一维卷积、实例增强)。
  • 使用可学习的决策模块,基于输入特征通过可微门控机制计算每个激励算子的注意力权重。
  • 对决策模块的输出应用Sigmoid激活函数,生成软注意力权重,以确定每个算子的贡献度。
  • 通过加权和的方式整合所有激励算子的输出,其中权重由决策模块动态预测。
  • 端到端训练整个网络,使决策模块与网络联合优化,以根据每组输入选择最有效的算子组合。
  • 采用模块化、即插即用的设计,使SEM可轻松嵌入现有CNN架构中,无需修改网络结构。

实验结果

研究问题

  • RQ1不同网络层是否能从不同类型的激励算子中获益,而非在整个网络中使用单一固定算子?
  • RQ2通过动态选择机制组合多个激励算子,是否能相比使用单一算子获得更好的性能?
  • RQ3所提出的可切换机制能否基于输入内容和网络深度自适应地选择最有效的算子?
  • RQ4动态切换机制是否提供正则化优势,尤其在低数据场景下减少过拟合?
  • RQ5该可切换模块在不同主干网络深度(如ResNet47至ResNet362)和数据集(CIFAR-10、CIFAR-100)上的性能表现如何扩展?

主要发现

  • 当应用于ResNet362时,SEM在CIFAR-100上实现了Top-1准确率2.00%的绝对提升,从70.41%提高到77.72%。
  • 在ResNet164上,SEM在CIFAR-10上提升Top-1准确率1.72%,在CIFAR-100上提升2.43%,表明在不同深度下均保持一致的性能增益。
  • 随着集成中激励算子数量(N)的增加,SEM性能也随之提升:在CIFAR-100上,Top-1准确率从N=1时的75.28%提升至N=3时的76.76%。
  • 移除决策模块(将权重固定为1)导致CIFAR-100上的Top-1准确率下降0.47%,证实了动态切换机制的有效性。
  • 在决策模块中使用Sigmoid激活函数时性能最佳(CIFAR-100上达到76.76%),而ReLU和LeakyReLU表现较差,表明对非线性类型的选择具有敏感性。
  • 在无数据增强的情况下,SEM在CIFAR-10上实现了89.58%的Top-1准确率,优于ResNet164(87.18%)和SENet(88.24%),表明其具有正则化效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。