Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding

Pengchuan Zhang, Xiyang Dai|arXiv (Cornell University)|2021. 03. 29.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 다중 해상도 계층적 설계와 Longformer의 2차원 변형인 局소+전역 주의 메커니즘을 결합한 비전 트랜스포머 아키텍처인 Multi-Scale Vision Longformer (ViL)을 제안한다. 이는 고해상도 이미지 인코딩을 효율적으로 수행할 수 있도록 하며, 계산 복잡도가 선형인 동시에 강력한 기준 모델들—ResNet, PVT, Swin Transformer—을 능가한다. 이미지 분류, 객체 검출, 인스턴스 세그멘테이션 작업에서 더 적은 파라미터와 FLOPs로도 뛰어난 성능을 달성한다.

ABSTRACT

This paper presents a new Vision Transformer (ViT) architecture Multi-Scale Vision Longformer, which significantly enhances the ViT of \cite{dosovitskiy2020image} for encoding high-resolution images using two techniques. The first is the multi-scale model structure, which provides image encodings at multiple scales with manageable computational cost. The second is the attention mechanism of vision Longformer, which is a variant of Longformer \cite{beltagy2020longformer}, originally developed for natural language processing, and achieves a linear complexity w.r.t. the number of input tokens. A comprehensive empirical study shows that the new ViT significantly outperforms several strong baselines, including the existing ViT models and their ResNet counterparts, and the Pyramid Vision Transformer from a concurrent work \cite{wang2021pyramid}, on a range of vision tasks, including image classification, object detection, and segmentation. The models and source code are released at \url{https://github.com/microsoft/vision-longformer}.

연구 동기 및 목표

  • 고해상도 이미지를 처리할 때 표준 비전 트랜스포머(ViT)의 제곱형 계산 및 메모리 복잡도 문제를 해결한다.
  • 객체 검출 및 세그멘테이션과 같은 조밀한 예측 작업에 필요한 고해상도 특징 맵을 효율적으로 인코딩할 수 있도록 한다.
  • 비전 및 언어 모델 아키텍처를 통합하기 위해, 다중 해상도 비전 작업에서 CNN 성능을 충족하거나 능가하는 비전 트랜스포머를 개발한다.
  • 성능을 유지하면서 계산 비용을 줄이는 비전 전용 효율적인 주의 메커니즘을 설계한다.
  • 다양한 비전 벤치마크—분류, 검출, 세그멘테이션—에서 제안된 아키텍처의 효과성을 입증한다.

제안 방법

  • 각 스테이지에서 공간 해상도가 감소하고 은닉 차원이 증가하는 방식으로, ResNet 스타일의 계층적 특징 학습을 모방하는 다중 해상도 모델 구조를 구현한다.
  • 각 스테이지에서 패치 임bedding을 적용하여 특징 맵을 점진적으로 다운샘플링하면서 표현 능력을 증가시킨다.
  • Longformer 주의 메커니즘의 2차원 변형을 도입하여, 국소 윈도우 주의와 고정된 수의 전역 토큰을 사용함으로써 시퀀스 길이에 대해 선형 복잡도를 달성한다.
  • 절대 위치 임베딩에 의존하지 않고 상대적 위치 편향(RPB)을 사용하여 주의 학습을 향상시킨다.
  • 소형 및 중형 버전의 모델 학습을 위해 3배 이상의 학습 스케줄을 적용하여 수렴성과 성능을 향상시킨다.
  • 표준 검출 및 세그멘테이션 파ip라인(RetinaNet, Mask R-CNN 등)에 아키텍처를 통합하여 엔드 투 엔드 평가를 수행한다.

실험 결과

연구 질문

  • RQ1다중 해상도 비전 트랜스포머 아키텍처는 고해상도 이미지 작업에서 표준 ViT 및 ResNet보다 더 높은 정확도와 효율성을 달성할 수 있는가?
  • RQ22차원 Longformer 주의 메커니즘은 표준 자기 주의와 비교해 계산 및 메모리 비용을 줄이면서도 성능을 유지하는가?
  • RQ3다중 해상도 설계와 효율적인 주의 메커니즘의 조합은 객체 검출 및 인스턴스 세그멘테이션과 같은 조밀한 예측 작업에서 어떤 영향을 미치는가?
  • RQ4윈도우 크기 및 전역 토큰 수와 같은 하이퍼파라미터가 고해상도 환경에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5제안된 아키텍처는 정확도, FLOPs, 파라미터 수 측면에서 Swin Transformer 및 피라미드 비전 트랜스포머와 같은 동시대 모델을 능가할 수 있는가?

주요 결과

  • 3x+MS 학습 스케줄을 적용한 ViL-Tiny는 ImageNet-1K 분류에서 ResNeXt101-64x4d와 PVT-Large를 능가하며, 더 적은 파라미터로 높은 top-1 정확도를 달성한다.
  • RetinaNet 기반 COCO 객체 검출에서 ViL-Small는 45M 파라미터로 47.1 AP^b를 기록하여, Swin-Tiny(46.0 AP^b, 48M 파라미터)를 초월한다.
  • Mask R-CNN 기반 인스턴스 세그멘테이션에서 ViL-Small는 42.9 AP^b를 기록하며, SRA, Performer, Global 주의와 같은 다른 효율적 주의 메커니즘보다 뚜렷하게 뛰어난 성능을 보였다.
  • 제거 실험 결과, 객체 검출에서 윈도우 크기 15가 최적의 성능을 내며, 전역 토큰을 하나 이상 추가해도 추가적인 이득이 없다는 것이 확인되었다.
  • 부분 주의(예: 첫 두 스테이지에서만 적용)를 사용할 경우에도 ViL 모델은 전체 주의 버전과 비교해 0.4 AP^b 이하의 성능 격차만 보이며 강력한 성능 유지를 보였다.
  • 동일한 FLOPs 및 파라미터 예산 하에서, 바닐라 ViT에 비해 다중 해상도 구조가 정확도를 크게 향상시켜 계층적 특징 학습의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.