[논문 리뷰] DLGSANet: Lightweight Dynamic Local and Global Self-Attention Networks for Image Super-Resolution
DLGSANet는 다중 헤드 동적 국소 자기주의(MHDLSA)를 통해 국소 특징을 추출하고, 희소 전역 자기주의(SparseGSA)를 통해 선택적 전역 특징 집합을 수행하는 하이브리드 동적-Transformer 블록(HDTB)을 사용하는 경량이고 효율적인 이미지 초해상도 네트워크를 제안한다. 이 방법은 500만 미만의 파라미터와 이전 모델들보다 훨씬 낮은 FLOPs를 기반으로 최신 기술 수준의 성능을 달성한다.
We propose an effective lightweight dynamic local and global self-attention network (DLGSANet) to solve image super-resolution. Our method explores the properties of Transformers while having low computational costs. Motivated by the network designs of Transformers, we develop a simple yet effective multi-head dynamic local self-attention (MHDLSA) module to extract local features efficiently. In addition, we note that existing Transformers usually explore all similarities of the tokens between the queries and keys for the feature aggregation. However, not all the tokens from the queries are relevant to those in keys, using all the similarities does not effectively facilitate the high-resolution image reconstruction. To overcome this problem, we develop a sparse global self-attention (SparseGSA) module to select the most useful similarity values so that the most useful global features can be better utilized for the high-resolution image reconstruction. We develop a hybrid dynamic-Transformer block(HDTB) that integrates the MHDLSA and SparseGSA for both local and global feature exploration. To ease the network training, we formulate the HDTBs into a residual hybrid dynamic-Transformer group (RHDTG). By embedding the RHDTGs into an end-to-end trainable network, we show that our proposed method has fewer network parameters and lower computational costs while achieving competitive performance against state-of-the-art ones in terms of accuracy. More information is available at https://neonleexiang.github.io/DLGSANet/
연구 동기 및 목표
- 기존의 트랜스포머 기반 초해상도 모델들이 가지는 높은 계산 비용과 파라미터 부담 문제를 해결하기 위해.
- 고정된 윈도우 기반의 자기주의에서 벗어나, 컨볼루션 유사 동적 설계를 통해 유연한 국소 특징 추출을 가능하게 하는 동적, 컨volution 유사 국소 자기주의를 도입하여 국소 특징 추출을 향상시키기 위해.
- 유사도 계산 후 ReLU를 적용하여 덜 관련성이 높은 자기주의 값을 제거하는 희소 메커니즘을 통해 전역 특징 집합을 개선하고, 관련 없는 토큰으로 인한 노이즈를 방지하기 위해.
- 최소한의 파라미터와 FLOPs로도 높은 재구성 품질을 유지하는 경량이며, 엔드 투 엔드로 훈련 가능한 네트워크를 개발하기 위해.
제안 방법
- 고정된 윈도우 제약 없이 효율적인 국소 특징 학습을 가능하게 하는 완전 컨볼루션 설계를 사용해 동적 자기주의 가중치를 학습하는 다중 헤드 동적 국소 자기주의(MHDLSA) 모듈을 도입한다.
- 유사도 계산 후 ReLU를 적용하여 덜 관련성이 높은 자기주의 값을 제거하고, 가장 유용한 전역 특징만 유지하는 희소 전역 자기주의(SparseGSA) 모듈을 제안한다.
- MHDLSA와 SparseGSA를 융합하여 국소 및 전역 의존성을 효율적인 파라미터 사용으로 동시에 캡처하는 하이브리드 동적-Transformer 블록(HDTB)을 설계한다.
- 잔차 학습을 통해 훈련 안정성과 특징 표현력을 향상시키기 위해 잔차 하이브리드 동적-Transformer 그룹(RHDTG)을 구성한다.
- 스택된 RHDTG로 구성된 엔드 투 엔드 훈련 가능한 전체 DLGSANet 아키텍처를 설계하여 고해상도 이미지 재구성 기능을 제공한다.
- 최소한의 파라미터 수와 낮은 FLOPs를 기반으로 한 경량 설계를 적용하여 표준 벤치마크에서 경쟁 가능한 성능을 달성한다.
실험 결과
연구 질문
- RQ1고정된 윈도우 분할에 의존하지 않고도, 동적 국소 자기주의 메커니즘이 초해상도 네트워크의 국소 특징 추출을 향상시킬 수 있는가?
- RQ2희소 메커니즘을 통해 덜 관련성이 높은 전역 자기주의 값을 제거함으로써, 더 나은 특징 표현과 재구성 품질을 달성할 수 있는가?
- RQ3동적 국소 및 희소 전역 자기주의를 융합한 하이브리드 자기주의 블록이 상당히 감소된 모델 복잡도로 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ4기존의 CNN 및 트랜스포머 기반 SISR 모델들과 비교해, 제안된 방법은 정확도, 파라미터 수, 추론 속도 측면에서 어떻게 성능을 내는가?
주요 결과
- Urban100 데이터셋에서 ×4 확대 시 DLGSANet은 기준 모델(MHSA)보다 0.28dB 높은 PSNR 27.17을 기록한다.
- 희소 전역 자기주의(SparseGSA) 모듈은 표준 소프트맥스 기반 전역 자기주의보다 PSNR를 0.12dB 향상시킨다.
- 모델은 단지 476만 개의 파라미터와 RTX 3090 GPU에서 ×4 확대 시 187ms의 추론 시간을 가지며, SwinIR(278ms) 및 ELAN(243ms)보다 현저히 낮다.
- 경량 버전인 DLGSANet-tiny는 ×4에서 38ms의 추론 시간을 기록하며, EDSR-baseline(15ms)보다 정확도가 높고 대부분의 트랜스포머 기반 모델보다도 더 효율적이다.
- 제거 분석 결과, MHDLSA와 SparseGSA 모두 성능 향상에 크게 기여하며, 각각 기준 모델 대비 PSNR를 0.28dB, 0.12dB 향상시킨다.
- 시각화 결과는 SparseGSA가 관련 없는 자기주의 값을 효과적으로 억제하고, 구조적이고 세부 정보를 유지하는 특징에 집중함으로써 더 나은 재구성 품질을 달성함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.