Skip to main content
QUICK REVIEW

[논문 리뷰] HRViT: Multi-Scale High-Resolution Vision Transformer

Jiaqi Gu, Hyoukjun Kwon|arXiv (Cornell University)|2021. 11. 01.
Advanced Neural Network Applications참고 문헌 18인용 수 8
한 줄 요약

HRViT는 다중 스케일, 고해상도 비전 트랜스포머 아키텍처를 도입하여 이질적인 다중브랜치 설계, 선형 레이어의 중복 감소, 비선형성 증가를 통해 정밀 예측 성능을 향상시킨다. ADE20K에서 50.20% mIoU, Cityscapes에서 83.16% mIoU를 기록하여 MiT와 CSWin과 같은 SOTA 모델을 +1.78 mIoU 뛰어넘고, 파라미터 수를 28% 감소시키고 FLOPs를 21% 감소시켰다.

ABSTRACT

Vision transformers (ViTs) have attracted much attention for their superior performance on computer vision tasks. To address their limitations of single-scale low-resolution representations, prior work adapts ViTs to high-resolution dense prediction tasks with hierarchical architectures to generate pyramid features. However, multi-scale representation learning is still under-explored on ViTs, given their classification-like sequential topology. To enhance ViTs with more capability to learn semantically-rich and spatially-precise multi-scale representations, in this work, we present an efficient integration of high-resolution multi-branch architectures with vision transformers, dubbed HRViT, pushing the Pareto front of dense prediction tasks to a new level. We explore heterogeneous branch design, reduce the redundancy in linear layers, and augment the model nonlinearity to balance the model performance and hardware efficiency. The proposed HRViT achieves 50.20% mIoU on ADE20K and 83.16% mIoU on Cityscapes for semantic segmentation tasks, surpassing state-of-the-art MiT and CSWin with an average of +1.78 mIoU improvement, 28% parameter reduction, and 21% FLOPs reduction, demonstrating the potential of HRViT as strong vision backbones.

연구 동기 및 목표

  • 정밀 예측 작업을 위한 다중 스케일, 고해상도 표현을 학습하는 데 있어 비전 트랜스포머의 한계를 해결하기 위해.
  • ViT의 순차적이고 분류 중심의 아키텍처 구조가 효과적인 다중 스케일 특징 학습을 방해하는 문제를 해결하기 위해.
  • 성능과 계산 비용의 균형을 맞추는 효율적이고 하드웨어 우수한 아키텍처를 설계하기 위해.
  • 모델 크기와 FLOPs를 줄이며 mIoU를 향상시켜 정밀 예측 모델의 파레토 경계를 개선하기 위해.

제안 방법

  • HRViT는 다중 브랜치 아키텍처를 비전 트랜스포머에 통합하여 다중 스케일 간 병렬이고 이질적인 특징 학습을 가능하게 한다.
  • 브랜치 간 파라미터 공유 또는 제거를 통해 선형 레이어의 중복을 줄여 파라미터 효율성을 향상시킨다.
  • 비선형 활성화 함수를 브랜치 전반에 전략적으로 보강하여 계산 비용을 크게 증가시키지 않으면서도 표현 능력을 향상시킨다.
  • 계층적 설계를 통해 네트워크 전반에 걸쳐 고해상도 특징을 유지하여 정밀한 공간적 지도를 가능하게 한다.
  • 공간적 세부 정보를 유지하면서도 다중 스케일 특징 통합을 가능하게 하는 특수한 토큰 혼합 메커니즘을 사용한다.
  • 추론 효율성 최적화를 통해 계산 부담을 줄이고 높은 정확도를 달성한다.

실험 결과

연구 질문

  • RQ1해상도 또는 효율성을 희생시키지 않고 비전 트랜스포머를 효과적으로 다중 스케일 표현 학습에 확장할 수 있는가?
  • RQ2이질적인 다중브랜치 설계는 정밀 예측 작업을 위한 ViT의 특징 학습을 어떻게 향상시킬 수 있는가?
  • RQ3성능을 유지하거나 향상시키면서도 선형 레이어의 중복을 줄일 수 있는 아키텍처 수정은 무엇인가?
  • RQ4ViT에서 계산 비용을 크게 증가시키지 않고 비선형성을 얼마나 강화할 수 있는가?
  • RQ5HRViT는 세분화 평가 기준에서 기존 SOTA 모델보다 정확도와 효율성 면에서 모두 뛰어나게 성능을 낼 수 있는가?

주요 결과

  • HRViT는 ADE20K 세분화 평가 기준에서 50.20% mIoU를 기록하여 새로운 SOTA를 수립했다.
  • Cityscapes 데이터셋에서 HRViT는 83.16% mIoU를 달성하여 이전 SOTA 모델을 +1.78 mIoU 뛰어넘었다.
  • MiT와 CSWin과 같은 SOTA 모델 대비 파라미터 수를 28% 감소시켰다.
  • 우수한 성능을 유지하면서도 FLOPs를 21% 감소시켜 더 뛰어난 하드웨어 효율성을 입증했다.
  • 다중 브랜치 및 고해상도 설계 덕분에 특징 맵의 더 높은 공간 정밀도와 의미적 풍부함을 확보할 수 있었다.
  • 비선형성 통합과 파라미터 공유가 계산 비용을 증가시키지 않으면서도 표현 능력을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.