Skip to main content
QUICK REVIEW

[论文解读] On the Relationship between Self-Attention and Convolutional Layers

Jean-Baptiste Cordonnier, Andreas Loukas|arXiv (Cornell University)|Nov 8, 2019
Advanced Neural Network Applications被引用 89
一句话总结

本文证明多头自注意力与相对位置编码可以表达任意卷积层,并在实证中展示早期层的注意力头学习网格状、类似CNN的局部模式。

ABSTRACT

Recent trends of incorporating attention mechanisms in vision have led researchers to reconsider the supremacy of convolutional layers as a primary building block. Beyond helping CNNs to handle long-range dependencies, Ramachandran et al. (2019) showed that attention can completely replace convolution and achieve state-of-the-art performance on vision tasks. This raises the question: do learned attention layers operate similarly to convolutional layers? This work provides evidence that attention layers can perform convolution and, indeed, they often learn to do so in practice. Specifically, we prove that a multi-head self-attention layer with sufficient number of heads is at least as expressive as any convolutional layer. Our numerical experiments then show that self-attention layers attend to pixel-grid patterns similarly to CNN layers, corroborating our analysis. Our code is publicly available.

研究动机与目标

  • 激发问题:自注意力层是否能像卷积层一样处理图像。
  • 给出在理论上自注意力可以复制卷积层的条件。
  • 通过实验验证,在仅依赖注意力的网络的早期层,注意力头学到局部、网格状的模式。

提出的方法

  • 给出一个具备相对位置编码的多头自注意力层能够表达任何卷积层的构造性证明(定理1)。
  • 表明在二次或学习的相对位置编码下,注意力头会在每个查询像素周围关注网格状的局部模式。
  • 推导将卷积重新参数化为自注意力的充分条件(引理1和引理2)。
  • 在 CIFAR-10 上对六层自注意力模型进行实验,观察注意力模式并将准确率与 ResNet-18 进行比较。
  • 分析二次和学习的相对位置编码,包括基于内容的注意力,以研究局部性与全局依赖性。

实验结果

研究问题

  • RQ1多头自注意力结合相对位置编码是否能够复制卷积层的功能行为?
  • RQ2在使用图像数据进行训练时,注意力头在早期层是否实际学习到局部、卷积式感受野?
  • RQ3不同的位置编码方案(二次与学习的相对编码)如何影响视觉变换器中的局部化和基于内容的注意力?
  • RQ4在标准图像分类任务上,注意力为主架构与传统 CNN 相比的经验性能和计算成本权衡如何?

主要发现

  • 具备足够头数和相对位置编码的多头自注意力层可以表达任何卷积层(卷积核大小 K×K,输出通道数为 min(Dh, Dout))。
  • 在实际中,早期的注意力层学会对查询像素周围的网格状、局部模式进行关注,类似卷积的感受野。
  • 二次与学习的相对编码都产生了局部化的注意力模式,后续层会关注更大规模的模式并在更深层中引入基于内容的注意力。
  • 在 CIFAR-10 上,注意力模型在参数量相近的情况下达到与 ResNet-18 相当的准确性,尽管某些配置落后(例如带内容注意力的学习嵌入)。
  • 早期层的注意力概率往往避免重叠、以多样的局部模式覆盖输入空间,而较深层则表现出更全局、以内容为驱动的注意力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。