Skip to main content
QUICK REVIEW

[论文解读] Less is More: Pay Less Attention in Vision Transformers

Zizheng Pan, Bohan Zhuang|arXiv (Cornell University)|May 29, 2021
Advanced Neural Network Applications被引用 8
一句话总结

本文提出 Less is More:在视觉变换器中减少注意力(LIT),一种分层视觉变换器,通过用多层感知机(MLPs)替换早期的自注意力层,以降低计算成本,同时保持性能。通过仅在深层应用自注意力,并引入可学习的可变形标记合并(DTM)模块,LIT 在图像分类、目标检测和实例分割任务上实现了最先进(SOTA)的准确率,同时相比之前的视觉变换器显著降低了浮点运算次数(FLOPs)和内存使用量。

ABSTRACT

Transformers have become one of the dominant architectures in deep learning, particularly as a powerful alternative to convolutional neural networks (CNNs) in computer vision. However, Transformer training and inference in previous works can be prohibitively expensive due to the quadratic complexity of self-attention over a long sequence of representations, especially for high-resolution dense prediction tasks. To this end, we present a novel Less attention vIsion Transformer (LIT), building upon the fact that the early self-attention layers in Transformers still focus on local patterns and bring minor benefits in recent hierarchical vision Transformers. Specifically, we propose a hierarchical Transformer where we use pure multi-layer perceptrons (MLPs) to encode rich local patterns in the early stages while applying self-attention modules to capture longer dependencies in deeper layers. Moreover, we further propose a learned deformable token merging module to adaptively fuse informative patches in a non-uniform manner. The proposed LIT achieves promising performance on image recognition tasks, including image classification, object detection and instance segmentation, serving as a strong backbone for many vision tasks. Code is available at: https://github.com/zhuang-group/LIT

研究动机与目标

  • 为解决分层视觉变换器(HVTs)早期阶段自注意力带来的高计算和内存开销,尤其是在高分辨率特征图上的问题。
  • 探究在具有二次方复杂度的情况下,HVT 中早期自注意力层是否对最终性能有实质性贡献。
  • 通过设计比标准均匀图像块合并更自适应、更具信息量的标记合并机制,改进分层表征学习。
  • 在不牺牲密集预测任务性能的前提下,实现模型准确率与推理效率之间的更好权衡。

提出的方法

  • 用纯 MLP 块替换分层视觉变换器的前两个阶段,以捕捉局部模式,避免在高分辨率特征上进行昂贵的自注意力计算。
  • 仅在序列长度减少的深层阶段应用标准多头自注意力(MSA),从而高效建模长距离依赖关系。
  • 提出一种可变形标记合并(DTM)模块,通过学习空间偏移量,自适应地从局部区域采样并合并有信息量的图像块,提升几何变换建模能力。
  • 采用可学习的非均匀合并策略,通过聚焦显著的空间区域,优于标准卷积或线性图像块合并方法。
  • 设计 LIT 时保持与 PVT 和 Swin 变换器一致的架构超参数,包括匹配的图像块大小和通道维度,以确保公平比较。
  • 在 ImageNet、COCO 和 ADE20K 基准上训练和评估 LIT,以验证其性能和效率的提升。

实验结果

研究问题

  • RQ1考虑到在高分辨率特征上自注意力具有二次方计算复杂度,其在视觉变换器中的早期阶段是否能带来显著的性能增益?
  • RQ2能否通过用 MLP 替换早期自注意力来维持或提升性能,同时大幅降低 FLOPs 和内存使用量?
  • RQ3与固定、均匀的图像块合并相比,可学习的可变形标记合并机制是否能提升分层视觉变换器中的特征表示质量?
  • RQ4通过仅在深层应用自注意力,是否能在视觉变换器设计中实现性能与效率的“最佳平衡点”?
  • RQ5在多种视觉基准上,所提出的 LIT 架构与最先进视觉变换器相比,在准确率、FLOPs 和内存消耗方面表现如何?

主要发现

  • LIT 在 ImageNet-1K 分类任务上达到最先进性能,Top-1 准确率为 85.7%,仅使用 1.8G FLOPs,优于 Swin-Tiny 和 PVT-S,且参数量更少。
  • 在 COCO 目标检测和实例分割任务上,LIT-B 分别达到 46.8 AP 和 42.3 掩码 AP,性能与 Swin-B 和 PVT-B 相当或更优,且 FLOPs 更低。
  • 可变形标记合并(DTM)模块学习的空间偏移量能自适应地匹配物体形状和几何变换,从而在特征表示质量上优于标准合并方式。
  • 可视化结果表明,标准 HVT 中早期 MSA 层仅关注极小的局部区域,表明早期阶段自注意力的收益微乎其微。
  • 与 Swin-Tiny 和 PVT-S 相比,LIT 将 FLOPs 最多降低 30%,同时保持或提升准确率,展现出强大的效率-准确率权衡优势。
  • 消融研究证实,用 MLP 替换早期自注意力可带来显著的效率提升,且性能下降可忽略,验证了 LIT 的核心设计原则。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。