[论文解读] MPViT: Multi-Path Vision Transformer for Dense Prediction
MPViT 提出了一种多路径视觉 Transformer 模型,采用多尺度图像块嵌入,通过并行的 Transformer 编码器同时处理细粒度和粗粒度视觉特征,在 ImageNet、COCO 和 ADE20K 上实现了 SOTA 性能,且参数量和 FLOPs 均少于先前的 SOTA ViT 模型。
Dense computer vision tasks such as object detection and segmentation require effective multi-scale feature representation for detecting or classifying objects or regions with varying sizes. While Convolutional Neural Networks (CNNs) have been the dominant architectures for such tasks, recently introduced Vision Transformers (ViTs) aim to replace them as a backbone. Similar to CNNs, ViTs build a simple multi-stage structure (i.e., fine-to-coarse) for multi-scale representation with single-scale patches. In this work, with a different perspective from existing Transformers, we explore multi-scale patch embedding and multi-path structure, constructing the Multi-Path Vision Transformer (MPViT). MPViT embeds features of the same size~(i.e., sequence length) with patches of different scales simultaneously by using overlapping convolutional patch embedding. Tokens of different scales are then independently fed into the Transformer encoders via multiple paths and the resulting features are aggregated, enabling both fine and coarse feature representations at the same feature level. Thanks to the diverse, multi-scale feature representations, our MPViTs scaling from tiny~(5M) to base~(73M) consistently achieve superior performance over state-of-the-art Vision Transformers on ImageNet classification, object detection, instance segmentation, and semantic segmentation. These extensive results demonstrate that MPViT can serve as a versatile backbone network for various vision tasks. Code will be made publicly available at \url{https://git.io/MPViT}.
研究动机与目标
- 解决视觉 Transformer 在需要多尺度特征理解的密集预测任务中,单尺度图像块表示的局限性。
- 通过实现多尺度特征的并行独立处理,克服现有共尺度机制(如 CoaT)带来的计算和内存开销。
- 通过整合重叠卷积图像块嵌入与多条并行 Transformer 路径,提升特征表示的多样性。
- 实现有效的全局到局部特征交互,将卷积的局部归纳偏置与自注意力的全局上下文相结合。
- 开发一种多功能主干网络,在减少模型复杂度的前提下,持续在多个视觉基准上超越 SOTA 视觉 Transformer 模型。
提出的方法
- 对同一输入图像应用具有不同卷积核大小(例如 3×3、5×5、7×7)的重叠卷积图像块嵌入,以提取多尺度图像块,同时保持一致的序列长度。
- 将来自不同图像块尺度的 token 输入到独立的、并行的 Transformer 编码器路径中,以在每个尺度上独立计算全局自注意力。
- 通过全局到局部特征交互(GLI)机制聚合多条路径的特征,该机制将局部卷积特征与全局 Transformer 特征进行拼接。
- 采用多路径架构,使每条路径专注于特定的感受野范围——路径-1 用于精细细节,路径-3 用于粗粒度语义,路径-2 用于中间尺度。
- 使用标准 DeiT 风格的训练方案在 ImageNet-1K 上训练模型,随后在 COCO 和 ADE20K 上进行微调,用于检测、分割和分类任务。
- 可视化各路径的注意力图,以分析尺度特定的注意力行为,并验证互补的特征学习。
实验结果
研究问题
- RQ1在多路径 Transformer 架构中,多尺度图像块嵌入是否能提升密集预测任务的特征表示多样性?
- RQ2在多个基准上,MPViT 在准确率、参数量和 FLOPs 方面与 SOTA 视觉 Transformer 模型相比表现如何?
- RQ3MPViT 中各条路径在关注不同尺寸或语义层级的对象方面,其专属性程度如何?
- RQ4全局到局部特征交互机制是否能有效结合多路径设置下的局部归纳偏置与全局自注意力?
- RQ5MPViT 的失败模式是什么?注意力图与误分类案例之间是否存在相关性?
主要发现
- MPViT-Small(22M 参数,4 GFLOPs)在 COCO 上实现 43.9 的掩码 AP,优于更大的 Focal-Base 模型(89M 参数,16 GFLOPs),后者仅达到 43.7 AP。
- 在 ImageNet-1K 上,MPViT-Tiny(5M 参数)实现 83.5% 的 top-1 准确率,优于 SOTA ViT 模型如 Swin-B 和 CoaT-Lite-S。
- 全局到局部特征交互机制通过结合卷积的局部细节与自注意力的全局上下文,提升了特征质量。
- 可视化分析表明,路径-1 专注于小物体和纹理,路径-3 强调大物体和语义概念,路径-2 展现出中间行为。
- 失败分析显示,当语义相似的物体(如叉车与拖车卡车)获得强烈注意力时,注意力图常导致错误预测,表明注意力与模型预测之间存在相关性。
- MPViT 在实例分割(COCO)、语义分割(ADE20K)和目标检测(COCO)任务上均达到 SOTA 性能,证明其作为主干网络的多功能性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。