Skip to main content
QUICK REVIEW

[论文解读] Local-to-Global Self-Attention in Vision Transformers

Jinpeng Li, Yichao Yan|arXiv (Cornell University)|Jul 10, 2021
Infrared Target Detection Methodologies参考文献 59被引用 22
一句话总结

本文提出 LG-Transformer,一种视觉变换器中的多路径自注意力机制,可在每个阶段内实现多尺度的局部到全局特征推理。通过将窗口化多头自注意力(W-MSA)应用于不同分辨率下采样的特征图——局部(1/8)、中等层次(1/16)和全局(1/32)——该模型高效地捕捉了局部细节与全局上下文,相较于基线模型在 ImageNet 上实现 0.9% 的 Top-1 准确率提升,在 ADE20K 上实现 0.8% 的 mIoU 提升,且计算开销几乎不变。

ABSTRACT

Transformers have demonstrated great potential in computer vision tasks. To avoid dense computations of self-attentions in high-resolution visual data, some recent Transformer models adopt a hierarchical design, where self-attentions are only computed within local windows. This design significantly improves the efficiency but lacks global feature reasoning in early stages. In this work, we design a multi-path structure of the Transformer, which enables local-to-global reasoning at multiple granularities in each stage. The proposed framework is computationally efficient and highly effective. With a marginal increasement in computational overhead, our model achieves notable improvements in both image classification and semantic segmentation. Code is available at https://github.com/ljpadam/LG-Transformer

研究动机与目标

  • 解决层次化视觉变换器在早期阶段因局部自注意力机制而缺乏全局推理能力的局限性。
  • 在单一高效架构中整合卷积神经网络(CNN)的局部归纳偏置与变换器的全局建模能力。
  • 在不显著增加计算成本的前提下,提升图像分类与语义分割任务的性能。
  • 验证多粒度注意力路径在增强不同尺度特征表示方面的有效性。

提出的方法

  • 设计一个多路径自注意力模块,将特征图下采样至三个尺度:原始分辨率的 1/8、1/16 和 1/32。
  • 在每个尺度上独立应用窗口化多头自注意力(W-MSA),以建模局部与全局依赖关系。
  • 在每个阶段聚合所有路径的特征,形成更具判别性的表示。
  • 采用受 Swin Transformer 启发的层次化 Transformer 架构,但将每个块扩展为多条注意力路径。
  • 通过仅在最小尺度(1/32)上应用全局注意力,保持计算效率,从而降低全局计算成本。
  • 在不引入新操作的前提下实现该框架,确保兼容性与易于集成。

实验结果

研究问题

  • RQ1在不带来高计算成本的前提下,多粒度的局部到全局特征推理是否能提升视觉变换器的性能?
  • RQ2与单路径局部注意力相比,多路径注意力在收敛速度与准确率方面表现如何?
  • RQ3结合局部与全局注意力路径是否能提升图像分类与语义分割任务中的泛化能力?
  • RQ4为实现性能增益,多路径模块在各阶段中的最优部署位置是什么?
  • RQ5该模型的推理速度与标准单路径变换器相比如何?

主要发现

  • LG-Transformer 在 ImageNet-1K 图像分类任务上相比 Swin-Transformer 实现了 0.9% 的 Top-1 准确率提升,且 FLOPs 增加可忽略不计。
  • 在 ADE20K 语义分割基准上,LG-Transformer 相比 Swin-T* 实现了 0.8% 的 mIoU 提升,性能与参数量和 FLOP 预算相近的模型相当。
  • 该模型收敛更快,训练损失更低,验证准确率更高,表明其优化稳定性得到改善。
  • 定性分析显示,局部注意力图(1/8 和 1/16 尺度)存在明显不连续性,而全局注意力(1/32 尺度)则捕捉到连贯的整体图像上下文。
  • 在更多阶段中添加 LG-Attention 模块可一致提升验证性能与训练收敛性,证明了多路径设计的优势。
  • 尽管准确率提升,但由于多路径结构的存在,模型的推理速度仍慢于单路径基线模型,表明准确率与速度之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。