[논문 리뷰] SpA-Former: Transformer image shadow detection and removal via spatial attention
SpA-Former는 공간 주의와 푸리에 변환 잔차 블록을 활용하여 장기적 의존성을 포착하고 저주파수 및 고주파수 세부 정보를 유지하는 일괄 처리, 엔드 투 엔드의 트랜스포머 기반 네트워크를 제안한다. ISTD 데이터셋에서 PSNR 33.51과 RMSE 6.86을 기록하며 최신 기술 수준의 성능을 달성하였으며, 표준 GPU 하드웨어에서도 학습이 가능하다.
In this paper, we propose an end-to-end SpA-Former to recover a shadow-free image from a single shaded image. Unlike traditional methods that require two steps for shadow detection and then shadow removal, the SpA-Former unifies these steps into one, which is a one-stage network capable of directly learning the mapping function between shadows and no shadows, it does not require a separate shadow detection. Thus, SpA-former is adaptable to real image de-shadowing for shadows projected on different semantic regions. SpA-Former consists of transformer layer and a series of joint Fourier transform residual blocks and two-wheel joint spatial attention. The network in this paper is able to handle the task while achieving a very fast processing efficiency. Our code is relased on https://github.com/zhangbaijin/SpA-Former-shadow-removal
연구 동기 및 목표
- 두 단계 그림자 제거 방법의 한계를 해결하기 위해 별도의 검출 및 제거 단계가 필요로 하는 기존 방법의 계산 비용이 높고 다양한 의미적 영역에 적응성이 떨어지는 문제를 해결한다.
- 그림자 제거 과정에서 발생하는 잔여물, 조명 불일치, CNN에서의 장기적 공간적 의존성 모델링의 어려움을 극복한다.
- 그림자 영역에서 그림자 없는 영상으로의 매핑을 직접 학습할 수 있는 단일, 효율적인 일괄 처리 네트워크로 그림자 검출과 제거를 통합한다.
- 공간 주의와 푸리에 변환 잔차 블록을 통합하여 국소 세부 정보를 더 잘 유지하고 장기적 맥락을 효과적으로 모델링함으로써 성능을 향상시킨다.
제안 방법
- 이 네트워크는 자기 주의 메커니즘을 활용하여 영상 전반에 걸친 장기적 의존성을 모델링하는 트랜스포머 기반 인코더-디코더 아키텍처를 채택한다.
- 이중 경로 주의 학습을 통해 공간적으로 관련 있는 영역에 집중함으로써 기능 표현을 향상시키는 '이중 휠 통합 공간 주의' 모듈을 도입한다.
- 공간 특징을 주파수 도메인으로 변환하여 잔차 학습을 수행함으로써 저주파수 및 고주파수 성분을 동시에 모델링하는 새로운 푸리에 변환 잔차(Fourier Transform Residual, FTR) 블록을 설계한다.
- 후처리 없이 엔드 투 엔드로 학습이 가능하여 단일 입력 영상으로부터 직접 그림자 없는 영상을 예측할 수 있다.
- 구조적 및 의미적 충실도를 유지하기 위해 L1 손실과 인지적 손실의 조합을 사용하여 모델을 학습시킨다.
실험 결과
연구 질문
- RQ1분리된 검출 또는 정밀 조정 단계 없이도 일괄 처리 딥 러닝 프레임워크가 그림자 검출과 제거를 효과적으로 통합할 수 있는가?
- RQ2공간 주의와 푸리에 잔차 블록을 통합할 경우 기존의 표준 CNN에 비해 그림자 제거 성능이 어떻게 향상되는가?
- RQ3트랜스포머 기반 아키텍처가 그림자 영상에서 장기적 의존성을 얼마나 잘 모델링할 수 있는가? 이는 복원 품질 향상에 어떤 기여를 하는가?
- RQ4제안된 방법은 소비자용 GPU에서 빠른 추론 속도를 유지하면서도 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- SpA-Former는 ISTD 데이터셋에서 PSNR 33.51을 기록하여 DSC, DHAN, SID 등의 이전 방법들을 능가한다.
- 모델은 RMSE 6.86을 기록하여 기준 모델(7.87)보다 유의미하게 낮아, 더 높은 픽셀 수준의 복원 정확도를 보여준다.
- 트랜스포머, FTR 블록, 이중 휠 공간 주의의 조합이 가장 높은 성능을 내며, 기준 모델 대비 PSNR에서 2.5% 향상되었다.
- 제거 분석 결과, FTR 블록과 공간 주의 모두 성능 향상에 기여하며, 전체 모델은 그림자 영역에서 가장 높은 SSIM(0.982)를 기록했다.
- 네트워크는 단일 1080Ti GPU에서 배포 가능하여 실생활 응용에 있어 높은 효율성과 낮은 하드웨어 장벽을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.