[논문 리뷰] HRFormer: High-Resolution Transformer for Dense Prediction
HRFormer는 고해상도 다중 스케일 표현을 로컬 윈도우 자기‑주의 및 FFN 깊이별 컨볼루션과 결합하여 효율적인 밀도 예측을 가능하게 하며, 유사한 HRNet 및 트랜스포머 기반 베이스라인보다 적은 파라미터와 FLOPs를 사용하면서 자세 추정과 의미 분할에서 강한 성능을 달성한다.
We present a High-Resolution Transformer (HRFormer) that learns high-resolution representations for dense prediction tasks, in contrast to the original Vision Transformer that produces low-resolution representations and has high memory and computational cost. We take advantage of the multi-resolution parallel design introduced in high-resolution convolutional networks (HRNet), along with local-window self-attention that performs self-attention over small non-overlapping image windows, for improving the memory and computation efficiency. In addition, we introduce a convolution into the FFN to exchange information across the disconnected image windows. We demonstrate the effectiveness of the High-Resolution Transformer on both human pose estimation and semantic segmentation tasks, e.g., HRFormer outperforms Swin transformer by $1.3$ AP on COCO pose estimation with $50\%$ fewer parameters and $30\%$ fewer FLOPs. Code is available at: https://github.com/HRNet/HRFormer.
연구 동기 및 목표
- 전통적인 ViT 스타일의 저해상도 출력보다 더 높은 해상도 표현으로 밀도 예측을 촉진한다.
- 고해상도 스트림을 보존하면서 스케일 간 정보 교환을 가능하게 하는 트랜스포머 블록을 설계한다.
- 로컬 윈도우 자기-주의 및 합성된 FFN(컨볼루션 보강)으로 메모리와 연산을 줄인다.
- 고해상도와 저해상도 스트림을 병렬로 유지하기 위해 HRNet 스타일의 다중 해상도 융합을 통합한다.
- 자세 추정, 의미 분할 및 ImageNet 분류에서 효과를 입증한다.
제안 방법
- HRNet에서 영감을 받은 다중 해상도 병렬 아키텍처를 채택하여 각 단계에서 고해상도 표현을 유지한다.
- 겹치지 않는 KxK 이미지 윈도 내에서 로컬-윈도우 자기-주의를 구현하여 공간 크기에 대한 메모리 및 연산을 제곱에서 선형으로 줄인다.
- FFN에 3x3 깊이별 컨볼루션을 도입하여 비중첩 윈도 간 정보 교환과 수용 영역 확장을 가능하게 한다.
- 로컬 윈도우 자기-주의에서 상대 위치 임베딩을 사용하여 공간 구조를 포함한다.
- HRNet의 융합 설계에 따라 교차 해상도 정보 교환을 위한 컨볼루션 다중 스케일 융합 모듈을 사용한다.
- 네 해상도 스트림에 걸쳐 트랜스포머 블록을 배열하고, 기본적으로 4단계 아키텍처에서 윈도 사이즈를 (7,7,7,7)로 고정한다.
실험 결과
연구 질문
- RQ1고해상도 다중 스케일 트랜스포머 표현이 자세 추정 및 의미 분할과 같은 밀도 예측 작업을 개선할 수 있는가?
- RQ2로컬 윈도우 자기-주의와 FFN의 깊이별 컨볼루션을 결합하는 것이 전체 글로벌 주의 대비 메모리와 연산을 낮추면서도 경쟁력 있는 정확도를 제공하는가?
- RQ3HRNet에서 영감을 받은 다중 해상도 융합 전략이 트랜스포머 블록과 어떻게 상호 작용하여 작업 전반의 성능을 높이는가?
- RQ4설계 선택(윈도우 크기, FFN 구조)이 시각 작업 전반의 정확도와 효율성에 어떤 영향을 미치는가?
주요 결과
- HRFormer-B는 COCO 검증 자세 추정에서 파라미터 32% 감소, FLOPs 19% 감소로 HRNet-W48보다 0.9% AP를 개선했다.
- HRFormer-B + OCR은 PASCAL-Context에서 HRNet-W48 + OCR보다 1.2% mIoU, COCO-Stuff에서 2.0% mIoU 향상시키며 파라미터는 25% 감소하고 FLOPs는 비슷하다.
- ImageNet-1K에서 HRFormer-B가 DeiT-B를 상회하는 1.0% 상위-1 정확도를 달성하면서 파라미터는 약 40% 줄고 FLOPs는 약 20% 줄었다.
- HRFormer-T/S/B는 자세 추정 및 분할 작업 전반에서 HRNet 대역과 경쟁력 있는 트랜스포머 베이스라인을 능가하며, 현저히 낮은 파라미터 및 연산 비용을 보여준다.
- 특성 제거(Abalation) 결과 FFN의 3x3 depth-wise 컨볼루션은 DW conv 없이 FFN 대비 ImageNet, PASCAL-Context 및 COCO 지표를 크게 향상시킨다.
- 자세 추정에서 ViT/DeiT/Swin 기반선과 비교할 때, HRFormer-B는 더 적은 파라미터와 FLOPs로 더 나은 결과를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.