[논문 리뷰] Magic ELF: Image Deraining Meets Association Learning and Transformer
이 논문은 연속된 CNN과 트랜스포머를 연관 학습을 통해 통합하여 plating streak 제거와 배경 세부 정보 복원을 동시에 최적화하는 경량 이미지 비정상 제거 모델인 Magic ELF를 제안한다. 다중 입력 어텐션 모듈과 디프 웨이즈 분리형 컨볼루션을 도입함으로써 ELF는 MPRNet 대비 88.4% 낮은 계산 비용과 11.7%의 파라미터로 SOTA 성능을 달성하며, 평균 PSNR에서 0.25 dB 높은 성능을 기록하고 실시간 추론을 가능하게 한다.
Convolutional neural network (CNN) and Transformer have achieved great success in multimedia applications. However, little effort has been made to effectively and efficiently harmonize these two architectures to satisfy image deraining. This paper aims to unify these two architectures to take advantage of their learning merits for image deraining. In particular, the local connectivity and translation equivariance of CNN and the global aggregation ability of self-attention (SA) in Transformer are fully exploited for specific local context and global structure representations. Based on the observation that rain distribution reveals the degradation location and degree, we introduce degradation prior to help background recovery and accordingly present the association refinement deraining scheme. A novel multi-input attention module (MAM) is proposed to associate rain perturbation removal and background recovery. Moreover, we equip our model with effective depth-wise separable convolutions to learn the specific feature representations and trade off computational complexity. Extensive experiments show that our proposed method (dubbed as ELF) outperforms the state-of-the-art approach (MPRNet) by 0.25 dB on average, but only accounts for 11.7\% and 42.1\% of its computational cost and parameters. The source code is available at https://github.com/kuijiang94/Magic-ELF.
연구 동기 및 목표
- 이미지 비정상 제거에서 CNN의 장거리 의존성 파악 능력 부족과 트랜스포머의 국소적 특징 학습 능력 부족 문제를 해결하기 위해.
- 로컬 불변성과 글로벌 어텐션을 활용하기 위해 CNN과 트랜스포머 아키텍처를 통합하여 개선된 비정상 제거 성능을 달성하기 위해.
- 이미지 비정상 제거 및 후속 작업에서 성능을 유지하거나 향상시키면서 계산 비용을 감소시키기 위해.
- 비정상 제거 모델의 적대적 공격에 대한 강건성을 향상시키기 위해.
- 객체 검출과 같은 후속 비전 작업과의 공동 성능을 향상시키기 위해.
제안 방법
- 비정상 제거와 배경 복원을 별개이지만 연관된 학습 경로로 분리하는 이중 단계 아키텍처를 제안한다.
- 비정상 왜곡 및 배경 복원 브랜치의 특징을 동적으로 연관시키기 위한 다중 입력 어텐션 모듈(MAM)을 도입한다.
- 모델 복잡도를 감소시키면서도 특징 표현 능력을 유지하기 위해 깊이 분리형 컨볼루션을 활용한다.
- 비의 분포에서 유도된 열악한 조건 사전 지식을 활용해 배경 복원을 안내하고 구조적 일관성을 향상시킨다.
- 비정상 제거와 세부 구조 복원 작업 간의 호환성을 향상시키기 위해 공동 최적화 전략을 채택한다.
- 공유된 표현 개선을 가능하게 하는 동적 연관 학습 메커니즘을 도입해 엔드 투 엔드 학습을 지원한다.
실험 결과
연구 질문
- RQ1통합된 CNN-Transformer 아키텍처가 독립적인 CNN 또는 트랜스포머 모델보다 이미지 비정상 제거에서 뛰어난 성능을 낼 수 있는가?
- RQ2CNN의 국소 불변성과 트랜스포머의 글로벌 어텐션을 비정상 제거에 효과적으로 통합할 수 있는가?
- RQ3비의 분포에서 유도된 열악한 조건 사전 지식이 배경 복원을 향상시키고 잔여 잡음(잔여 아티팩트)을 줄일 수 있는가?
- RQ4경량 모델이 상당히 감소된 계산 비용으로 SOTA 성능을 달성할 수 있는가?
- RQ5비정상 제거와 세부 구조 복원의 공동 학습이 객체 검출과 같은 후속 작업 성능을 향상시킬 수 있는가?
주요 결과
- ELF는 TEST1200 데이터셋에서 평균 PSNR 33.38 dB를 기록하며, MPRNet보다 0.25 dB 높은 성능을 내며 파라미터는 11.7%뿐이고 FLOPs는 42.1%에 그친다.
- ELF-LW는 COCO350/BDD350에서 각각 18.43/18.09 dB의 PSNR를 기록하며, PCNet을 0.52 dB 뛰어넘고 계산 비용도 낮아 (21.53 vs. 28.21 GFLOPs).
- YOLOv3를 사용한 객체 검출 작업에서 ELF는 BDD350에서 정밀도 33.85%와 IoU 62.61%를 기록하며 모든 기준 모델을 능가한다.
- LMSE 및 LPIPS 기준으로 다른 비정상 제거 모델 대비 ELF는 적대적 공격에 대해 뛰어난 강건성을 보였다.
- 시각적 결과에서 ELF는 경쟁 모델 대비 더 깔끔하고 자연스러운 이미지를 생성하며, 비 잔여물이 적고 텍스처가 더 잘 보존된 것으로 나타났다.
- Restormer 대비 추론 시간을 88.0% 감소시켜 512×512 이미지에서 125 ms를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.