[논문 리뷰] Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation
HRViT는 다중 분량, 고해상도 비전 트랜스포머 백본을 통합한 다중다발 아키텍처와 자기주의 메커니즘을 결합하여 공간 정밀도와 의미적 풍부성을 향상시켜 세분화에 적합한 모델을 제안한다. ADE20K에서 50.20% mIoU, Cityscapes에서 83.16% mIoU를 기록하며, MiT와 CSWin과 같은 SOTA 모델보다 +1.78 mIoU 높은 성능을 내며 파arameter 수를 28% 감소시키고 FLOPs를 21% 감소시켰다.
Vision Transformers (ViTs) have emerged with superior performance on computer vision tasks compared to convolutional neural network (CNN)-based models. However, ViTs are mainly designed for image classification that generate single-scale low-resolution representations, which makes dense prediction tasks such as semantic segmentation challenging for ViTs. Therefore, we propose HRViT, which enhances ViTs to learn semantically-rich and spatially-precise multi-scale representations by integrating high-resolution multi-branch architectures with ViTs. We balance the model performance and efficiency of HRViT by various branch-block co-optimization techniques. Specifically, we explore heterogeneous branch designs, reduce the redundancy in linear layers, and augment the attention block with enhanced expressiveness. Those approaches enabled HRViT to push the Pareto frontier of performance and efficiency on semantic segmentation to a new level, as our evaluation results on ADE20K and Cityscapes show. HRViT achieves 50.20% mIoU on ADE20K and 83.16% mIoU on Cityscapes, surpassing state-of-the-art MiT and CSWin backbones with an average of +1.78 mIoU improvement, 28% parameter saving, and 21% FLOPs reduction, demonstrating the potential of HRViT as a strong vision backbone for semantic segmentation.
연구 동기 및 목표
- 비전 트랜스포머(ViTs)가 단일 해상도, 저해상도 특징 표현으로 인해 세분화 작업에서 성능에 한계를 가짐을 해결한다.
- HRNet를 영감으로 삼은 다중다발 아키텍처를 통합하여 ViT에 고해상도, 다중 분량 특징 학습 능력을 향상시킨다.
- 자기주의 블록, 피드포워드 네트워크, 임bedding 레이어의 공동 최적화를 통해 다중다발 ViT의 효율성과 확장성을 향상시킨다.
- AR/VR 기기와 같은 자원 제약이 있는 플랫폼에서 밀도 높은 예측 작업을 위한 ViT 기반 백본의 성능과 효율성을 균형 잡는다.
- 순수한 ViT 백본에 이질적인 다중다발 설계를 적용할 경우, 컨볼루션 및 순차적 ViT 기반 모델보다 세분화 정확도와 효율성에서 뛰어난 성능을 낼 수 있음을 입증한다.
제안 방법
- 모든 스케일에서 특징을 유지하고 융합하는 다중다발 고해상도 아키텍처를 도입하여 스케일 간 상호작용을 가능하게 한다.
- 과도한 키/밸류 제거와 병렬 컨볼루션 경로, 비선형성 추가를 통해 표현력과 효율성을 향상시킨 보완된 局소 자기주의 메커니즘을 제안한다.
- MLP 블록 내에서 다중 스케일 컨볼루션 피드포워드 네트워크(FFNs)를 활용하여 다중 스케일 특징 추출 능력을 강화한다.
- 저수준의 세밀한 특징을 유지하면서 계산 비용을 줄이는 효율적인 HR 컨볼루션 스템과 패치 임베딩 레이어를 설계한다.
- 다른 브랜치가 서로 다른 아키텍처 구성 요소(예: 다양한 창 크기, 자기주의 유형)를 사용하도록 이질적인 브랜치 설계를 구현하여 성능과 효율성의 균형을 이룬다.
- 선형 레이어의 중복 제거 및 보조 스위치를 포함한 브랜치-블록 공동 최적화 기법을 적용하여 표현력은 유지하면서 모델 효율성을 향상시킨다.
실험 결과
연구 질문
- RQ1다중다발 비전 트랜스포머 아키텍처는 세분화 작업을 위한 고해상도, 다중 분량 표현을 효과적으로 학습할 수 있는가?
- RQ2다중다발 ViT의 높은 계산 비용은 성능을 유지하거나 향상시키면서 어떻게 완화할 수 있는가?
- RQ3고해상도 ViT에서 효율성과 표현 품질의 균형을 이루는 데 가장 효과적인 아키텍처 구성 요소와 공동 최적화 전략은 무엇인가?
- RQ4HRNet의 잔차 블록을 ViT 블록으로 대체할 경우, 순차적 ViT 백본 대비 밀도 높은 예측 작업에서 더 높은 성능을 낼 수 있는가?
- RQ5이질적인 다중다발 설계를 가진 순수한 ViT 백본은 컨볼루션 기반 HRNet 변종과 순차적 ViT 모델을 모두 능가하는 세분화 성능을 낼 수 있는가?
주요 결과
- HRViT는 ADE20K 검증 세트에서 50.20% mIoU를 기록하여 이전 SOTA(MiT 및 CSWin) 평균 +1.78 mIoU를 초월했다.
- Cityscapes 검증 세트에서는 83.16% mIoU를 기록하여 SOTA ViT 백본 대비 뚜렷한 성능 향상을 보였다.
- SOTA 모델 대비 모델 파라미터 수를 28% 감소시키고 FLOPs를 21% 줄여 뚜렷한 효율성 향상을 입증했다.
- HRViT-b3에서 최적의 창 크기는 9이며, 창 크기 7 대비 0.34 mIoU 향상과 0.8% 추가 FLOPs로 성능이 향상되었다.
- 과도한 창 크기(예: 15)는 성능을 0.26 mIoU 떨어뜨리고 FLOPs를 3.7% 증가시켜 최적 설정을 초과할 경우 성능 저하가 발생함을 시사했다.
- 직접 블록 교체를 수행한 원시 HRNet-ViT 기반 모델은 높은 계산 비용으로 인해 효율적으로 확장되지 못해, HRViT에서 공동 최적화 기법의 필요성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.