Skip to main content
QUICK REVIEW

[논문 리뷰] ResT V2: Simpler, Faster and Stronger

Qinglong Zhang, Yu-Bin Yang|arXiv (Cornell University)|2022. 04. 15.
Image Processing Techniques and Applications인용 수 14
한 줄 요약

이 논문은 다운샘플링 과정에서 손실된 고주파 특징을 복원하기 위해 EMSA의 멀티헤드 상호작용을 픽셀 셔플 업샘플링 전략으로 대체함으로써 더 단순하고 빠르며 강력한 비전 트랜스포머 백본인 ResT V2를 제안한다. ResT V2는 Swin Transformer와 ConvNeXt보다 더 높은 처리량과 더 적은 파라미터를 바탕으로 ImageNet, COCO, ADE20K에서 최신 기준 성능을 달성한다.

ABSTRACT

This paper proposes ResTv2, a simpler, faster, and stronger multi-scale vision Transformer for visual recognition. ResTv2 simplifies the EMSA structure in ResTv1 (i.e., eliminating the multi-head interaction part) and employs an upsample operation to reconstruct the lost medium- and high-frequency information caused by the downsampling operation. In addition, we explore different techniques for better apply ResTv2 backbones to downstream tasks. We found that although combining EMSAv2 and window attention can greatly reduce the theoretical matrix multiply FLOPs, it may significantly decrease the computation density, thus causing lower actual speed. We comprehensively validate ResTv2 on ImageNet classification, COCO detection, and ADE20K semantic segmentation. Experimental results show that the proposed ResTv2 can outperform the recently state-of-the-art backbones by a large margin, demonstrating the potential of ResTv2 as solid backbones. The code and models will be made publicly available at \url{https://github.com/wofmanaf/ResT}

연구 동기 및 목표

  • 성능을 훼손하지 않으면서 계산 비용을 줄이는 더 효율적이고 정확한 비전 트랜스포머 백본을 개발하기 위해.
  • 멀티헤드 자기어텐션에서 다운샘플링으로 인한 성능 저하 문제를 해결하기 위해 손실된 고주파 특징을 복원하기 위해.
  • 낮은 이론적 FLOPs가 항상 빠른 추론을 의미한다는 가정을 도전하기 위해, 특히 GPU 하드웨어에서의 상황을 고려하여.
  • 검출 및 세그멘테이션과 같은 후행 비전 작업에 ResT V2 백본을 효과적으로 적용할 수 있는 방법을 탐색하기 위해.

제안 방법

  • 복잡성을 줄이기 위해 멀티헤드 상호작용 구성 요소를 제거한 단순화된 멀티헤드 어텐션 모듈인 EMSAv2를 제안한다.
  • 다운샘플링 과정에서 손실된 중간 및 고주파 특징을 복원하기 위해 EMSAv2에 픽셀 셔플 업샘플링 연산을 도입한다.
  • '다운샘플-업샘플' 연산을 통해 경량의 컨볼루션 기반 아워글라스 아키텍처를 설계하여 국소적 특징 학습을 향상시킨다.
  • 학습 안정성 향상과 특징 표현 개선을 위해 잔차 연결 구조를 활용한다.
  • 다양한 전략을 평가하여 ResT V2를 후행 작업에 도입하는 방법을 검토한다. 이는 윈도우 어텐션 또는 글로벌 어텐션과 조합하는 것을 포함한다.
  • GPU 하드웨어에서 이론적 FLOPs와 실제 추론 속도 간의 상관관계를 분석하기 위해 추론 분석 실험을 수행한다.

실험 결과

연구 질문

  • RQ1EMSA에서 멀티헤드 상호작용을 제거하면 성능 저하 없이 효율성을 향상시킬 수 있는가?
  • RQ2픽셀 셔플을 통한 업샘플링이 자기어텐션 과정에서 손실된 정보를 효과적으로 복원하는가?
  • RQ3이론적 FLOPs는 낮추었음에도 불구하고 EMSAv2와 윈도우 어텐션을 조합하면 실제 추론 속도가 감소하는 이유는 무엇인가?
  • RQ4다양한 비전 작업에서 Swin Transformer와 ConvNeXt와 같은 최신 기준 백본과 비교할 때 ResT V2의 정확도와 속도는 어떻게 되는가?
  • RQ5현대 GPU 하드웨어에서 이론적 FLOPs가 실제 추론 속도와 얼마나 관련이 있는가?

주요 결과

  • ResT V2-L은 87M 파라미터로 ImageNet-1k에서 84.2% Top-1 정확도를 기록하여 Swin-B(83.5%)와 ConvNeXt-B(83.8%)를 능가하며, 415 이미지/초의 처리량을 달성한다.
  • COCO 객체 검출에서 ResT V2-T는 47.6 박스 AP와 43.2 마스크 AP를 기록하여 Swin-T(+1.6 AP)와 ConvNeXt-T(+1.4 AP)를 초월하며, 25.0 FPS의 더 높은 추론 속도(비교 대상: 21.8 및 23.4 FPS)를 확보한다.
  • ADE20K 세그멘테이션에서 ResT V2-T는 47.3 mIoU를 기록하여 Swin-T(45.8)와 ConvNeXt-T(46.7)를 능가하며, 22.4 FPS의 속도로 각각 5.3%와 12.6%의 속도 향상을 기록한다.
  • ResT V2-B는 ADE20K에서 49.6 mIoU를 기록하여 Swin-S(49.2)와 ConvNeXt-B(49.0)를 각각 0.4 및 0.6 mIoU 초월하며, 19.2 FPS의 속도로 Swin-S 대비 30.6%의 속도 향상을 기록한다.
  • 연구 결과, 윈도우 어텐션은 GPU에서 계산 밀도를 낮춰 이론적 FLOPs가 낮아도 실제 추론 속도가 느려지는 경향을 보여, FLOPs가 속도를 예측한다는 일반적인 가정을 도전한다.
  • EMSAv2의 '다운샘플-업샘플' 메커니즘은 최소한의 파라미터와 계산 오버헤드로 국소적 특징 학습을 향상시키는 경량의 아워글라스 구조를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.