Skip to main content
QUICK REVIEW

[논문 리뷰] SnowFormer: Context Interaction Transformer with Scale-awareness for Single Image Desnowing

Sixiang Chen, Ye Tian|arXiv (Cornell University)|2022. 08. 20.
Image Enhancement Techniques인용 수 7
한 줄 요약

SnowFormer는 다양한 눈 오염을 효과적으로 모델링하기 위해 스케일 인식 쿼리와 다중 헤드 크로스 어텐션을 통한 국소-전반적 맥락 상호작용을 활용하는 새로운 트랜스포머 기반 아키텍처이다. 이는 여섯 개인 합성 및 실세계 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 경쟁적인 계산 효율성도 확보한다.

ABSTRACT

Due to various and complicated snow degradations, single image desnowing is a challenging image restoration task. As prior arts can not handle it ideally, we propose a novel transformer, SnowFormer, which explores efficient cross-attentions to build local-global context interaction across patches and surpasses existing works that employ local operators or vanilla transformers. Compared to prior desnowing methods and universal image restoration methods, SnowFormer has several benefits. Firstly, unlike the multi-head self-attention in recent image restoration Vision Transformers, SnowFormer incorporates the multi-head cross-attention mechanism to perform local-global context interaction between scale-aware snow queries and local-patch embeddings. Second, the snow queries in SnowFormer are generated by the query generator from aggregated scale-aware features, which are rich in potential clean cues, leading to superior restoration results. Third, SnowFormer outshines advanced state-of-the-art desnowing networks and the prevalent universal image restoration transformers on six synthetic and real-world datasets. The code is released in \url{https://github.com/Ephemeral182/SnowFormer}.

연구 동기 및 목표

  • 기존 방법이 효과적으로 모델링하지 못하는 실세계 이미지에서의 복잡하고 비정규적이며 다중 스케일의 눈 오염 문제를 해결한다.
  • CNN 기반 및 일반적인 비전 트랜스포머 접근 방식의 국소 오염 패턴과 전반적 청소된 신호를 포괄하지 못하는 한계를 극복한다.
  • 스케일 인식, 비매개변수 기반 쿼리를 통해 효율적인 국소-전반적 맥락 상호작용을 가능하게 하여 복원 품질을 향상시킨다.
  • 위치 인코딩을 갖춘 오염 인식 어텐션 정련 헤드를 통해 尾부 특징에서 잔여 눈 오염을 점진적으로 감소시킨다.
  • 기존의 보편적인 이미지 복원 트랜스포머들에 비해 성능, 모델 복잡성, 추론 속도 간의 우수한 트레이드오���을 달성한다.

제안 방법

  • 패치 단위의 자체 어텐션을 사용하는 국소 상호작용(LI)을 도입하여 패치 내 오염 유사성을 모델링함으로써 국소 오염 인식 능력을 향상시킨다.
  • 다중 스케일 특징을 통합하여 생성된 쿼리 생성기로 스케일 인식 쿼리를 생성함으로써 추가적인 파라미터 없이도 전반적 맥락 인식 능력을 확보한다.
  • 스케일 인식 쿼리와 국소 패치 임베딩 간의 다중 헤드 크로스 어텐션을 활용하여 효율적인 국소-전반적 맥락 상호작용을 수행한다.
  • 최대 풀링과 요소별 덧셈을 통한 스케일 인식 특징 집합을 통해 다양한 공간적 눈 정보를 유지한다.
  • 오염 인식 위치 인코딩을 갖춘 어텐션 정련 헤드를 도입하여 꼬리 특징에서 잔여 눈 오염을 점진적으로 정련한다.
  • 비매개변수 기반 쿼리 메커니즘을 설계하여 일반적인 자체 어텐션의 높은 계산 비용을 피하면서도 전반적 맥락 통합을 유지한다.

실험 결과

연구 질문

  • RQ1크로스 어텐션을 통한 국소-전반적 맥락 상호작용이 CNN이나 표준 비전 트랜스포머를 초월하여 단일 이미지 눈 제거 성능을 향상시킬 수 있는가?
  • RQ2다중 스케일 특징에서 유도된 스케일 인식 쿼리 생성 방식이 학습 가능한 쿼리나 동일 레이어 쿼리에 비해 복원 성능 향상에 얼마나 기여하는가?
  • RQ3국소 상호작용을 통한 패치 내 오염 유사성 모델링이 국소 오염 인식 능력 향상에 얼마나 기여하는가?
  • RQ4제안된 어텐션 정련 헤드가 복잡한 영역에서 잔여 눈 오염을 효과적으로 감소시키는가?
  • RQ5기존의 보편적인 이미지 복원 트랜스포머들보다 낮은 계산 비용과 파라미터 수로 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?

주요 결과

  • SnowFormer는 CSD 데이터셋에서 최고의 PSNR 39.45 dB와 SSIM 0.983를 기록하여 모든 이전 SOTA 메서드를 능가한다.
  • 제거 실험을 통해 국소 상호작용(LI)이 패치 내 어텐션을 통해 기본 모델 대비 PSNR 2.53 dB 향상됨을 확인하였다.
  • 스케일 인식 쿼리 기반 국소-전반적 맥락 상호작용(LGCI)은 39.45 dB의 PSNR를 달성하여 학습 가능한 쿼리(38.03 dB)와 동일 레이어 쿼리(38.36 dB)를 크게 앞서며 유의미한 성능 향상을 보였다.
  • 최대 풀링과 덧셈을 조합한 스케일 인식 특징 집합이 가장 우수한 트레이드오프를 보였으며, 연결 방식 대비 1.3 dB 향상되고 최대 풀링 단독 대비 0.44 dB 향상되었다.
  • SnowFormer는 오직 8.38M 파라미터와 19.44 GFLOPs의 계산량을 유지하면서도, 훨씬 높은 FLOPs와 파라미터를 가진 메서드들을 능가하는 경쟁적인 효율성을 확보하였다.
  • 여섯 개인 다양한 데이터셋(합성 및 실세계 장면 포함)에서 SnowFormer는 일관되게 SOTA 성능을 달성하여 합성 및 실세계 눈 오염에 대한 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.