[논문 리뷰] Dual-former: Hybrid Self-attention Transformer for Efficient Image Restoration
Dual-former는 인코더-디코더 스테이지에서 컨볼루션 기반 국소적 특징 추출과 잠재층에서 단일 하이브리드 트랜스포머 블록(HTB)을 결합한 하이브리드 자체주의 트랜스포머 아키텍처를 제안한다. 이는 장거리 공간적 및 채널 간 의존성을 효율적으로 모델링하며, 이미지 탈안개, 탈비, 탈积雪 작업에서 최신 기술 수준의 성능을 달성하면서도 계산 비용을 크게 감소시킨다. 예를 들어, Indoor 탈안개 작업에서 MAXIM보다 1.91 dB의 PSNR 향상을 이뤄내며, GFLOPs의 단지 4.2%인 9.28G만을 소비한다.
Recently, image restoration transformers have achieved comparable performance with previous state-of-the-art CNNs. However, how to efficiently leverage such architectures remains an open problem. In this work, we present Dual-former whose critical insight is to combine the powerful global modeling ability of self-attention modules and the local modeling ability of convolutions in an overall architecture. With convolution-based Local Feature Extraction modules equipped in the encoder and the decoder, we only adopt a novel Hybrid Transformer Block in the latent layer to model the long-distance dependence in spatial dimensions and handle the uneven distribution between channels. Such a design eliminates the substantial computational complexity in previous image restoration transformers and achieves superior performance on multiple image restoration tasks. Experiments demonstrate that Dual-former achieves a 1.91dB gain over the state-of-the-art MAXIM method on the Indoor dataset for single image dehazing while consuming only 4.2% GFLOPs as MAXIM. For single image deraining, it exceeds the SOTA method by 0.1dB PSNR on the average results of five datasets with only 21.5% GFLOPs. Dual-former also substantially surpasses the latest desnowing method on various datasets, with fewer parameters.
연구 동기 및 목표
- 기존의 시각 트랜스포머 기반 이미지 복원 모델의 높은 계산 복잡도 문제를 해결하면서도 성능을 유지하거나 향상시키기 위해.
- 계산 비용이 효율적인 아키텍처에서 컨볼루션의 국소적 모델링 능력과 자체주의 전역적 모델링 능력을 결합하기 위해.
- 모든 레이어에서 전체 주의 메커니즘에 의존하는 것을 줄이기 위해, 자체주의 계산을 단일 잠재 레이어로 제한함으로써 FLOPs를 크게 감소시키기 위해.
- 더 적은 파라미터와 FLOPs로도 다양한 이미지 복원 벤치마크에서 최신 기술 수준의 방법을 능가하는 경량이면서도 강력한 백본을 설계하기 위해.
제안 방법
- 지속적인 국소적 표현 학습을 위해 인코더와 디코더 전반에 걸쳐 깊이 분리형 컨볼루션과 채널 주의 메커니즘을 기반으로 한 국소적 특징 추출(LFE) 모듈을 활용한다.
- 장거리 의존성을 모델링하고 채널 불균형을 처리하기 위해 공간-채널 동시 주의를 수행하는 하이브리드 트랜스포머 블록(HTB)을 잠재층에 도입한다.
- 공간 차원과 채널 차원 간의 기능 상호작용을 향상시키기 위해, 다중 주의 브랜치의 특징을 동적으로 융합하는 적응형 제어 모듈(ACM)을 구현한다.
- 대부분의 복잡도를 유지하면서 표현 능력을 향상시키기 위해 HTB 내부에 다중지점 피드포워드 네트워크(MFFN)를 적용한다.
- 재구성 정밀도와 시각적 품질을 향상시키기 위해 PSNR 손실과 인지적 손실을 조합한 하이브리드 손실 함수를 적용한다.
- 전체 주의 트랜스포머에 비해 FLOPs를 크게 줄이기 위해, 자체주의 계산을 오직 한 개의 버티컬 블로킹 레이어로 제한한다.
실험 결과
연구 질문
- RQ1단일 잠재 레이어로 자체주의 계산을 제한함으로써, 계산 비용을 크게 줄이면서도 전역적 모델링 능력을 유지할 수 있는가?
- RQ2국소적 특징 추출을 위한 컨볼루션과 목표 지향적 하이브리드 자체주의 블록을 조합함으로써 성능 및 효율성에 어떤 영향을 미치는가?
- RQ3잠재 레이어에서 공간적 및 채널 주의 간의 상호작용에 대해 적응형 기능 융합 메커니즘(ACM)의 영향은 무엇인가?
- RQ4LFE 모듈에 채널 주의를 통합함으로써 FLOPs를 크게 증가시키지 않고도 국소적 표현 학습이 얼마나 향상되는가?
- RQ5다양한 이미지 복원 작업에서 기존 최신 기술 수준의 방법과 비교했을 때, 제안된 하이브리드 아키텍처는 PSNR, SSIM 및 계산 효율성 측면에서 어느 정도의 성능을 보이는가?
주요 결과
- Single image dehazing 작업에서 Indoor 데이터셋에서 Dual-former는 SOTA인 MAXIM보다 1.91 dB의 PSNR 향상을 기록했으며, MAXIM의 GFLOPs의 단지 4.2%인 9.28G만을 소비했다 (216.0G 대비).
- 5개의 비가림 데이터셋에서 Dual-former는 평균 PSNR에서 SOTA 방법을 0.1 dB 뛰어넘었으며, GFLOPs는 21.5%에 불과했다 (9.28G 대비 140.92G).
- 적응형 제어 모듈(ACM)은 단순 연결이나 SK-퓨전보다 우수한 성능을 보였으며, 파라미터와 FLOPs의 약간의 증가로도 30.64 dB의 PSNR와 0.939의 SSIM을 달성했다.
- LFE 모듈에 채널 주의를 통합함으로써 PSNR는 0.42 dB 향상되었고 (30.22 → 30.64 dB), FLOPs는 미미하게 증가했으며 (9.24G → 9.28G), 파라미터 수도 12.52M에서 14.23M로 증가했다.
- HTB 내에서 병렬로 국소적 특징 추출을 수행함으로써, 비병렬 설계 대비 PSNR가 0.42 dB 향상되었으며, 계산 오버헤드는 극히 미미했다.
- PSNR 손실과 인지적 손실의 조합이 가장 우수한 성능을 보였으며 (30.64 dB PSNR, 0.939 SSIM), L1 또는 PSNR 전용 학습보다 뛰어났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.