[论文解读] Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding
本文提出多尺度视觉长注意Transformer(ViL),一种结合多尺度分层设计与Longformer局部+全局注意力机制二维变体的视觉Transformer架构,可实现高效、高分辨率图像编码。该方法具有线性计算复杂度,在图像分类、目标检测和实例分割任务上优于强基线模型(包括ResNets、PVT和Swin Transformer),且参数量和FLOPs更少。
This paper presents a new Vision Transformer (ViT) architecture Multi-Scale Vision Longformer, which significantly enhances the ViT of \cite{dosovitskiy2020image} for encoding high-resolution images using two techniques. The first is the multi-scale model structure, which provides image encodings at multiple scales with manageable computational cost. The second is the attention mechanism of vision Longformer, which is a variant of Longformer \cite{beltagy2020longformer}, originally developed for natural language processing, and achieves a linear complexity w.r.t. the number of input tokens. A comprehensive empirical study shows that the new ViT significantly outperforms several strong baselines, including the existing ViT models and their ResNet counterparts, and the Pyramid Vision Transformer from a concurrent work \cite{wang2021pyramid}, on a range of vision tasks, including image classification, object detection, and segmentation. The models and source code are released at \url{https://github.com/microsoft/vision-longformer}.
研究动机与目标
- 解决标准视觉Transformer(ViT)在处理高分辨率图像时的二次方计算与内存复杂度问题。
- 实现对目标检测与分割等密集预测任务所需高分辨率特征图的高效编码。
- 通过开发一种性能匹配或超越卷积神经网络(CNN)的视觉Transformer,统一视觉与语言模型架构。
- 设计一种面向视觉任务的高效注意力机制,在保持性能的同时降低计算成本。
- 在多样化视觉基准测试中(包括分类、检测与分割)验证所提架构的有效性。
提出的方法
- 通过堆叠多个视觉Transformer阶段构建多尺度模型结构,每个阶段的空间分辨率降低、隐藏维度增加,模仿ResNet风格的分层特征学习。
- 在每个阶段应用图像块嵌入,逐步下采样特征图的同时提升表征能力。
- 引入Longformer注意力机制的二维变体,通过局部窗口注意力与固定数量的全局令牌实现与序列长度呈线性关系的复杂度。
- 使用相对位置偏置(RPB)增强注意力学习,避免依赖绝对位置嵌入。
- 对小型与中型模型变体采用3倍以上训练调度以提升收敛性与性能。
- 将架构集成至标准检测与分割流水线(如RetinaNet、Mask R-CNN)中,实现端到端评估。
实验结果
研究问题
- RQ1多尺度视觉Transformer架构是否能在高分辨率图像任务中实现比标准ViT与ResNet更高的准确率与效率?
- RQ2与标准自注意力机制相比,2D Longformer注意力机制是否能在视觉任务中保持性能的同时降低计算与内存开销?
- RQ3多尺度设计与高效注意力机制的结合对目标检测与实例分割等密集预测任务的性能有何影响?
- RQ4窗口大小与全局令牌数量等超参数在高分辨率设置下如何影响模型性能?
- RQ5所提架构是否能在准确率、FLOPs与参数量方面超越同期模型(如Swin Transformer与金字塔视觉Transformer)?
主要发现
- 采用3x+MS训练调度的ViL-Tiny在ImageNet-1K分类任务中超越ResNeXt101-64x4d与PVT-Large,以更少参数实现更高top-1准确率。
- 在RetinaNet框架下的COCO目标检测任务中,ViL-Small以45M参数实现47.1 AP^b,优于Swin-Tiny(46.0 AP^b,48M参数)。
- 在基于Mask R-CNN的实例分割任务中,ViL-Small实现42.9 AP^b,显著优于SRA、Performer与全局注意力等其他高效注意力机制。
- 消融实验表明,窗口大小为15时在目标检测中表现最优,而增加超过一个全局令牌不再带来性能提升。
- 即使在仅使用部分注意力(如前两个阶段)的情况下,ViL模型仍保持强劲性能,仅比全注意力变体低0.4 AP^b。
- 在相同FLOPs与参数预算下,与原始ViT相比,多尺度结构显著提升了准确率,证明其在分层特征学习中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。