[논문 리뷰] Masked Autoencoders as Image Processors
이 논문은 채널 주의와 시프트된 윈도우 자기주의를 통합한 새로운 트랜스포머 기반 아키텍처인 CSformer를 사용하여 이미지 복원 작업을 위한 자기지도 학습 사전 훈련 프레임워크인 마스킹된 오토인코더를 이미지 프로세서로 사용하는 MAEIP를 제안한다. MAEIP는 마스킹된 패치와 전체 이미지를 동시에 재구성하여 고가우스 노이즈 제거, 실제 이미지 노이즈 제거, 운동 블러 제거, 초점 해상도 해제, 비 제거 등 다양한 작업에서 최신 기술 수준의 성능을 달성하며, 지도 학습 및 자기지도 학습 기반 모델보다 뚜렷한 성능 향상을 보였다.
Transformers have shown significant effectiveness for various vision tasks including both high-level vision and low-level vision. Recently, masked autoencoders (MAE) for feature pre-training have further unleashed the potential of Transformers, leading to state-of-the-art performances on various high-level vision tasks. However, the significance of MAE pre-training on low-level vision tasks has not been sufficiently explored. In this paper, we show that masked autoencoders are also scalable self-supervised learners for image processing tasks. We first present an efficient Transformer model considering both channel attention and shifted-window-based self-attention termed CSformer. Then we develop an effective MAE architecture for image processing (MAEIP) tasks. Extensive experimental results show that with the help of MAEIP pre-training, our proposed CSformer achieves state-of-the-art performance on various image processing tasks, including Gaussian denoising, real image denoising, single-image motion deblurring, defocus deblurring, and image deraining.
연구 동기 및 목표
- 마스킹된 오토인코더(MAE)가 고수준 비전 작업에서 효과적인 것으로 알려져 있으나, 이와 같은 기법이 이미지 복원과 같은 저수준 비전 작업으로 일반화될 수 있는지 탐구한다.
- 장거리 의존성 모델링과 계산 효율성을 향상시키기 위해 채널 주의와 시프트된 윈도우 자기주의를 통합한 효율적인 트랜스포머 기반 아키텍처인 CSformer를 설계한다.
- 마스킹된 패치와 전체 이미지를 동시에 재구성함으로써 이미지 처리에 특화된 새로운 MAE 기반 사전 훈련 프레임워크인 MAEIP를 개발한다.
- MAEIP를 통한 자기지도 사전 훈련이 다양한 이미지 복원 벤치마크에서 성능을 크게 향상시킬 수 있음을 입증한다.
제안 방법
- 채널별 주의와 시프트된 윈도우 자기주의를 통합한 계층적 설계를 가진 U-형 트랜스포머인 CSformer를 제안하여 장거리 의존성 모델링과 계산 효율성을 향상시킨다.
- 랜덤으로 마스킹된 이미지 패치를 입력으로 받아 인코더를 통해 마스킹된 패치를 재구성하고, 디코더를 통해 전체 이미지도 재구성하는 마스킹 오토인코딩 프레임워크인 MAEIP를 설계한다.
- 공간적 세부 정보를 유지하고 재구성 품질을 향상시키기 위해 스킵 연결을 갖춘 유넷 스타일 아키텍처를 채택한다.
- SIMMIM와 유사하게 직접 픽셀 재구성 방식을 사전 훈련 목적함으로 사용하며, 마스킹된 패치를 그대로 인코더에 입력한다.
- 효율성을 향상시키기 위해 이중 단계 사전 훈련 전략을 도입하여, 먼저 인코더만 사전 훈련하고, 이후 전체 모델을 피지테이닝한다.
- 사전 훈련된 CSformer를 표준 지도 학습 손실 함수를 사용하여 피지테이닝하여 최종 이미지 복원 작업에 적용한다.
실험 결과
연구 질문
- RQ1고수준 비전에서 효과적인 마스킹된 오토인코더(MAE)가 노이즈 제거 및 블러 제거와 같은 저수준 이미지 처리 작업으로 일반화될 수 있는가?
- RQ2채널 주의와 시프트된 윈도우 자기주의의 통합이 이미지 복원 트랜스포머의 성능과 효율성에 어떻게 기여하는가?
- RQ3MAEIP를 통해 마스킹된 패치와 전체 이미지를 동시에 재구성하는 것이 단일 목적 사전 훈련보다 더 나은 특징 학습을 이끌어내는가?
- RQ4사전 훈련 길이와 훈련 스케줄의 영향은 이미지 복원 작업의 최종 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 CSformer-T2는 SIDD 테스트 세트에서 39.77 dB의 PSNR를 기록하여 Uformer-S 성능을 재현하면서도 계산 비용을 43.86 GMACs에서 13.50 GMACs로 감소시켰다.
- MAEIP 사전 훈련을 통해 CSformer-T는 Rain100L 및 Test100 데이터셋에서 평균 0.5 dB 향상된 성능을 기록하였으며, 사전 훈련이 없는 경우와 비교해 뚜렷한 성능 향상을 보였다.
- 인코더와 디코더 출력을 동시에 재구성하는 MAEIP 방식이 인코더 또는 디코더만 사전 훈련하는 것보다 더 우수한 성능을 보였으며, 공동 재구성의 이점이 입증되었다.
- 이중 단계 사전 훈련 전략은 전체 60 에포크 사전 훈련과 비교해 25%의 훈련 시간을 절약하면서도 유사한 성능을 달성하였다.
- 60 에포크 사전 훈련은 30 에포크 사전 훈련보다 더 우수한 최종 성능을 보였으며, 더 긴 사전 훈련 스케줄의 이점이 확인되었다.
- MAEIP 프레임워크는 더 큰 모델로의 일반화 성능도 뛰어나 고가우스 노이즈 제거, 실제 이미지 노이즈 제거, 운동 블러 제거, 초점 해상도 해제, 비 제거 등에서 최신 기술 수준의 성능을 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.