[论文解读] Visual Attention Network
本文提出大型卷积核注意力(LKA),一种线性自注意力机制,能够保持二维图像结构,降低计算复杂度,并支持通道自适应。基于LKA构建的视觉注意力网络(VAN)在图像分类、目标检测和语义分割任务中均达到当前最先进性能,在ImageNet、COCO和ADE20K等基准上超越了同等规模的视觉Transformer和CNN模型。
While originally designed for natural language processing tasks, the self-attention mechanism has recently taken various computer vision areas by storm. However, the 2D nature of images brings three challenges for applying self-attention in computer vision. (1) Treating images as 1D sequences neglects their 2D structures. (2) The quadratic complexity is too expensive for high-resolution images. (3) It only captures spatial adaptability but ignores channel adaptability. In this paper, we propose a novel linear attention named large kernel attention (LKA) to enable self-adaptive and long-range correlations in self-attention while avoiding its shortcomings. Furthermore, we present a neural network based on LKA, namely Visual Attention Network (VAN). While extremely simple, VAN surpasses similar size vision transformers(ViTs) and convolutional neural networks(CNNs) in various tasks, including image classification, object detection, semantic segmentation, panoptic segmentation, pose estimation, etc. For example, VAN-B6 achieves 87.8% accuracy on ImageNet benchmark and set new state-of-the-art performance (58.2 PQ) for panoptic segmentation. Besides, VAN-B2 surpasses Swin-T 4% mIoU (50.1 vs. 46.1) for semantic segmentation on ADE20K benchmark, 2.6% AP (48.8 vs. 46.2) for object detection on COCO dataset. It provides a novel method and a simple yet strong baseline for the community. Code is available at https://github.com/Visual-Attention-Network.
研究动机与目标
- 为解决自注意力机制在计算机视觉中面临的局限性,包括将二维图像视为一维序列、二次方复杂度以及缺乏通道自适应能力。
- 通过结合卷积与自注意力的优势,设计一种更高效且适用于视觉任务的注意力机制。
- 提出一种简单但强大的视觉主干网络——视觉注意力网络(VAN),在多种视觉任务中实现最先进性能。
- 通过展示一种更优的替代方案,挑战自注意力机制在视觉模型中不可替代的假设。
提出的方法
- 提出大型卷积核注意力(LKA),一种线性注意力机制,利用大感受野卷积核建模长距离依赖关系,同时保持线性复杂度。
- 通过学习可动态调整的注意力权重,显式建模空间与通道自适应能力。
- 将LKA集成到简单的前馈神经网络架构中,构建视觉注意力网络(VAN),避免使用多头注意力或位置嵌入。
- 通过深度可分离卷积与通道缩放设计VAN,以保持高效性与参数效率。
- 在标准视觉基准上端到端训练VAN,采用标准优化策略,无需针对特定任务进行架构修改。
- 通过可学习的基于卷积核的注意力机制,融合卷积的2D归纳偏置与注意力的全局建模能力。
实验结果
研究问题
- RQ1线性注意力机制是否能在保持二维空间结构的同时,实现视觉任务中的长距离建模?
- RQ2一种融合通道自适应能力的自注意力机制是否在视觉基准上优于标准自注意力?
- RQ3一种基于新型注意力模块的简单网络是否能在不增加架构复杂度的前提下超越当前最先进视觉Transformer与CNN?
- RQ4所提出的LKA机制在高分辨率图像上是否比标准自注意力更高效且更有效?
- RQ5非Transformer主干网络是否能在多样化视觉任务中实现最先进性能?
主要发现
- VAN-B6在ImageNet-1K上达到87.8%的Top-1准确率,创下视觉主干网络的新SOTA记录。
- 在ADE20K语义分割基准上,VAN-B2的mIoU达到50.1%,较Swin-T高出4个百分点(46.1%)。
- 在COCO目标检测基准上,VAN-B2取得48.8%的AP,较Swin-T高出2.6个百分点(46.2% AP)。
- 在全景分割任务中,VAN-B6在COCO数据集上取得58.2 PQ,创下新SOTA纪录。
- 在细粒度CUB-200数据集上,VAN-B4在无需任务特定设计的情况下达到91.3%的Top-1准确率,超越DeiT与ViT-B。
- 在显著性检测任务中,VAN-B2在DUTS-TE数据集上取得0.919的F_max,优于ResNet与PVT主干网络,且MAE更低(0.028)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。