Skip to main content
QUICK REVIEW

[论文解读] ResT V2: Simpler, Faster and Stronger

Qinglong Zhang, Yu-Bin Yang|arXiv (Cornell University)|Apr 15, 2022
Image Processing Techniques and Applications被引用 14
一句话总结

本文提出 ResT V2,一种更简单、更快、更强的视觉 Transformer 主干网络,通过用像素重排上采样策略替代 EMSA 中的多头交互,恢复下采样过程中丢失的高频特征,从而提升性能。ResT V2 在 ImageNet、COCO 和 ADE20K 上均达到最先进精度,且在参数量更少、吞吐量更高的情况下优于 Swin Transformer 和 ConvNeXt。

ABSTRACT

This paper proposes ResTv2, a simpler, faster, and stronger multi-scale vision Transformer for visual recognition. ResTv2 simplifies the EMSA structure in ResTv1 (i.e., eliminating the multi-head interaction part) and employs an upsample operation to reconstruct the lost medium- and high-frequency information caused by the downsampling operation. In addition, we explore different techniques for better apply ResTv2 backbones to downstream tasks. We found that although combining EMSAv2 and window attention can greatly reduce the theoretical matrix multiply FLOPs, it may significantly decrease the computation density, thus causing lower actual speed. We comprehensively validate ResTv2 on ImageNet classification, COCO detection, and ADE20K semantic segmentation. Experimental results show that the proposed ResTv2 can outperform the recently state-of-the-art backbones by a large margin, demonstrating the potential of ResTv2 as solid backbones. The code and models will be made publicly available at \url{https://github.com/wofmanaf/ResT}

研究动机与目标

  • 开发一种更高效、更准确的视觉 Transformer 主干网络,降低计算成本而不损失性能。
  • 通过重建下采样过程中丢失的高频特征,解决多头自注意力中因下采样导致的性能下降问题。
  • 挑战在 GPU 硬件上理论 FLOPs 越低则推理越快的假设。
  • 探索将 ResT V2 主干网络有效应用于目标检测和语义分割等下游视觉任务的方法。

提出的方法

  • 提出 EMSAv2,一种简化版多头自注意力模块,通过移除多头交互组件以降低复杂度。
  • 在 EMSAv2 中引入像素重排上采样操作,以重建下采样过程中丢失的中高频特征。
  • 通过“下采样-上采样”操作设计一种轻量级、基于卷积的沙漏结构,以增强局部特征学习能力。
  • 采用残差连接结构以稳定训练并提升特征表示能力。
  • 评估多种将 ResT V2 部署于下游任务的策略,包括与窗口注意力或全局注意力结合使用。
  • 开展消融实验,分析理论 FLOPs 与 GPU 硬件上实际推理速度之间的权衡。

实验结果

研究问题

  • RQ1在 EMSA 中移除多头交互是否能在不降低性能的前提下提升效率?
  • RQ2通过像素重排进行上采样是否能有效恢复自注意力中因下采样而丢失的信息?
  • RQ3为何将 EMSAv2 与窗口注意力结合使用时,尽管理论 FLOPs 降低,但实际推理速度反而下降?
  • RQ4在多种视觉任务中,ResT V2 与 Swin Transformer 和 ConvNeXt 等最先进主干网络相比,在准确率和速度方面表现如何?
  • RQ5理论 FLOPs 与现代 GPU 硬件上的实际推理速度之间的相关性有多大?

主要发现

  • ResT V2-L 在 ImageNet-1k 上达到 84.2% 的 Top-1 准确率,参数量为 87M,优于 Swin-B(83.5%)和 ConvNeXt-B(83.8%),且吞吐量达 415 张/秒。
  • 在 COCO 目标检测任务中,ResT V2-T 达到 47.6 的 box AP 和 43.2 的 mask AP,分别优于 Swin-T(+1.6 AP)和 ConvNeXt-T(+1.4 AP),且推理速度更高(25.0 FPS vs. 21.8 和 23.4 FPS)。
  • 在 ADE20K 语义分割任务中,ResT V2-T 达到 47.3 mIoU,优于 Swin-T(45.8)和 ConvNeXt-T(46.7),推理速度为 22.4 FPS,分别提升 5.3% 和 12.6%。
  • ResT V2-B 在 ADE20K 上达到 49.6 mIoU,分别超过 Swin-S(49.2)和 ConvNeXt-B(49.0)0.4 和 0.6 mIoU,推理速度为 19.2 FPS,较 Swin-S 提升 30.6%。
  • 研究发现,窗口注意力在 GPU 上降低了计算密度,导致实际推理速度变慢,尽管理论 FLOPs 更低,这挑战了“FLOPs 越低则速度越快”的普遍假设。
  • EMSAv2 中的“下采样-上采样”机制形成一种轻量级沙漏结构,以极低的参数和计算开销显著增强局部特征学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。