[논문 리뷰] MaxSR: Image Super-Resolution Using Improved MaxViT
MaxSR는 개선된 MaxViT 아키텍처를 기반으로 한 새로운 이미지 슈퍼레졸루션 모델로, 저해상도 이미지 내 전역 자기유사성 특성을 효율적으로 모델링하기 위해 적응형 블록 및 격자 어텐션 메커니즘을 도입한다. 이 방법은 상대적 위치 임bedding이 필요 없이도 계산 효율성을 유지하면서도 고전적 및 경량 슈퍼레졸루션 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
While transformer models have been demonstrated to be effective for natural language processing tasks and high-level vision tasks, only a few attempts have been made to use powerful transformer models for single image super-resolution. Because transformer models have powerful representation capacity and the in-built self-attention mechanisms in transformer models help to leverage self-similarity prior in input low-resolution image to improve performance for single image super-resolution, we present a single image super-resolution model based on recent hybrid vision transformer of MaxViT, named as MaxSR. MaxSR consists of four parts, a shallow feature extraction block, multiple cascaded adaptive MaxViT blocks to extract deep hierarchical features and model global self-similarity from low-level features efficiently, a hierarchical feature fusion block, and finally a reconstruction block. The key component of MaxSR, i.e., adaptive MaxViT block, is based on MaxViT block which mixes MBConv with squeeze-and-excitation, block attention and grid attention. In order to achieve better global modelling of self-similarity in input low-resolution image, we improve block attention and grid attention in MaxViT block to adaptive block attention and adaptive grid attention which do self-attention inside each window across all grids and each grid across all windows respectively in the most efficient way. We instantiate proposed model for classical single image super-resolution (MaxSR) and lightweight single image super-resolution (MaxSR-light). Experiments show that our MaxSR and MaxSR-light establish new state-of-the-art performance efficiently.
연구 동기 및 목표
- 단일 이미지 슈퍼레졸루션(SISR)에서 트랜스포머 아키텍처의 강력한 표현력과 자기유사성 모델링 능력을 효율적으로 활용하는 데 도전한다.
- 고해상도 특징 맵에서 표준 자기유사성 어텐션의 제곱형 계산 복잡도 문제를 해결하기 위해, 전역 모델링 능력을 유지하면서도 제곱 이하 복잡도를 갖는 적응형 어텐션 메커니즘을 설계한다.
- MaxViT의 블록 및 격자 어텐션 메커니즘의 향상을 통해 창문과 격자 간의 동적이고 효율적인 정보 통합을 가능하게 하여 SISR 성능을 향상시킨다.
- 고성능 MaxSR와 경량 버전(MaxSR-light)을 개발하여 여러 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 모델 아키텍처는 얕은 특징 추출 블록, 다수의 연결된 적응형 MaxViT 블록, 계층적 특징 융합 블록, 그리고 픽셀 셔플과 컨볼루션 레이어를 사용한 재구성 블록으로 구성된다.
- 핵심 혁신은 적응형 MaxViT 블록으로, MaxViT의 고정 크기 블록 및 격자 어텐션을 동적으로 통합할 수 있는 적응형 버전으로 대체한다. 이는 각 격자 내 모든 창문과 각 창문 내 모든 격자 간의 정보를 동적으로 통합한다.
- 적응형 블록 어텐션은 각 창문 내에서 모든 격자 간의 자기유사성 어텐션을 계산하고, 적응형 격자 어텐션은 각 격자 내에서 모든 창문 간의 자기유사성 어텐션을 계산함으로써 효율적인 전역 특징 모델링을 가능하게 한다.
- 적응형 어텐션 메커니즘은 공간적 특징 맵 크기에 대해 최적의 제곱 이하 복잡도를 달성하도록 설계되어 장거리 의존성 모델링과 계산 효율성의 균형을 이룬다.
- 학습 중 적응형 어텐션과 고정 어텐션 메커니즘을 구별하기 위해 큰 패치 크기 128×128를 사용하며, 데이터 스트림 유지를 위해 배치 크기를 8로 조정한다.
- 두 가지 변종이 도입된다: 고전적 SISR를 위한 MaxSR와 경량 SISR를 위한 MaxSR-light로, 둘 다 표준 벤치마크에서 최신 기술 수준의 성능을 달성한다.
실험 결과
연구 질문
- RQ1비전 트랜스포머에서 적응형 자기유사성 어텐션 메커니즘이 계산 효율성을 유지하면서도 단일 이미지 슈퍼레졸루션의 전역 특징 모델링을 향상시킬 수 있는가?
- RQ2제안된 적응형 MaxViT 블록은 고정 어텐션 MaxViT 블록과 비교해 SISR 작업에서 성능 및 효율성 측면에서 어떻게 다른가?
- RQ3향상된 어텐션 메커니즘이 저해상도 이미지의 자기유사성 모델링을 얼마나 향상시켜 재구성 품질을 향상시킬 수 있는가?
- RQ4제안된 MaxSR 및 MaxSR-light 모델은 상대적 위치 임베딩에 의존하지 않고도 표준 SISR 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- MaxSR는 고전적 이미지 슈퍼레졸루션을 위한 다섯 개의 벤치마크 데이터셋에서 새로운 최신 기술 수준 성능을 달성했으며, EDSR, RCAN, RRDB, SwinIR, IPT 등의 기존 방법을 모두 능가한다.
- MaxSR-light는 경량 SISR 벤치마크에서 새로운 최신 기술 수준 결과를 확립했으며, DRRN, CARN, IMDN, SwinIR-light 등의 모델을 능가한다.
- 절단 분석 결과, 고정 어텐션 버전 대비 적응형 MaxViT 블록이 성능 향상에 크게 기여함을 확인했으며, BP-MaxSR는 모든 데이터셋에서 BP-Fix-SA-Tr-Fix-SA-Te를 능가한다.
- 추론 시에만 적응형 어텐션을 사용하는 경우(BP-Fix-SA-Tr-Ada-SA-Te)도 고정 어텐션 기반 베이스라인보다 성능 향상을 보이며, 적응성의 유용성을 입증한다.
- 상대적 위치 임베딩을 추가한 경우(BP-MaxSR-RPE) 성능이 더 향상되지만, 주요 MaxSR 모델은 이를 사용하지 않더라도 SOTA 성능을 달성하여 효율성 우선 원칙을 유지한다.
- Set14 및 Urban100에서의 시각적 비교 결과, MaxSR는 경쟁 모델 대비 더 선명한 윤곽선, richer 텍스처, 더 적은 잡음 또는 흐림 현상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.