Skip to main content
QUICK REVIEW

[논문 리뷰] WaveFill: A Wavelet-based Generation Network for Image Inpainting

Yingchen Yu, Fangneng Zhan|arXiv (Cornell University)|2021. 07. 23.
Advanced Image Processing Techniques참고 문헌 46인용 수 8
한 줄 요약

WaveFill는 이산 웨이블릿 변환(DWT)을 사용해 이미지를 주파수 대역으로 분해하는 웨이블릿 기반 이미지 복원 네트워크를 제안한다. 이는 저주파 구조에 대해 L1 손실을 별도로 최적화하고 고주파 세부 정보에 대해 생성적 적대적 손실을 적용함으로써 주파수 간 갈등을 완화한다. 주파수 분리 기반의 접근 방식은 상호 간섭을 줄이고, 새로운 주파수 영역에 민감한 정규화(FRAN) 모듈을 통해 대역 간 기능 일관성을 보장하여 다양한 벤치마크에서 정량적·정성적 평가에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Image inpainting aims to complete the missing or corrupted regions of images with realistic contents. The prevalent approaches adopt a hybrid objective of reconstruction and perceptual quality by using generative adversarial networks. However, the reconstruction loss and adversarial loss focus on synthesizing contents of different frequencies and simply applying them together often leads to inter-frequency conflicts and compromised inpainting. This paper presents WaveFill, a wavelet-based inpainting network that decomposes images into multiple frequency bands and fills the missing regions in each frequency band separately and explicitly. WaveFill decomposes images by using discrete wavelet transform (DWT) that preserves spatial information naturally. It applies L1 reconstruction loss to the decomposed low-frequency bands and adversarial loss to high-frequency bands, hence effectively mitigate inter-frequency conflicts while completing images in spatial domain. To address the inpainting inconsistency in different frequency bands and fuse features with distinct statistics, we design a novel normalization scheme that aligns and fuses the multi-frequency features effectively. Extensive experiments over multiple datasets show that WaveFill achieves superior image inpainting qualitatively and quantitatively.

연구 동기 및 목표

  • 공간 도메인에서 동시에 최적화되는 복원 및 적대적 손실로 인해 발생하는 인지-왜곡 갈등을 해결하기 위해.
  • 공간 특징이 뒤엉킨 상태에서 L1 및 적대적 손실을 동시에 적용할 때 발생하는 주파수 간 갈등을 줄이기 위해.
  • 이미지 복원 과정에서 주파수 대역 간 구조적 및 텍스처 일관성을 향상시키기 위해.
  • 다중 주파수 특징을 효과적으로 정렬하고 융합할 수 있는 정규화 기법을 개발하여 잡음 제거 및 세부 정보 유지에 기여하기 위해.
  • 직사각형 및 자유형 마스크를 포함한 다양한 데이터셋에서 뛰어난 복원 성능을 달성하기 위해.

제안 방법

  • 네트워크는 입력 이미지를 저주파(LF), 2단계 고주파(Lv2-HF), 1단계 고주파(Lv1-HF) 대역으로 분해하기 위해 2차원 이산 웨이블릿 변환(DWT)을 사용하여 공간 정보를 유지한다.
  • 저주파 대역은 게이트드 잔차 블록(GC ResBlock)을 통해 L1 복원 손실을 이용해 완성되고, 고주파 대역은 텍스처의 현실감을 향상시키기 위해 적대적 손실을 적용한다.
  • 다양한 주파수 대역 간 특징를 정렬하고 융합하여 일관성 있는 생성을 위해 새로운 주파수 영역에 민감한 정규화(FRAN) 모듈을 도입한다.
  • 다른 주파수 브랜치에서 유도된 특징들은 FRAN을 통해 전파되며, 주파수 특화 통계를 기반으로 한 주의 맵을 계산하여 특징 융합를 이끌어낸다.
  • 완성된 주파수 대역들은 역방향 웨이블릿 변환(IDWT)을 통해 공간 도메인으로 재구성되어 최종 복원 이미지를 생성한다.
  • 하이브리드 손실을 사용하여 엔드 투 엔드로 훈련되며, 이는 저주파 대역에 대한 L1 손실과 고주파 대역에 대한 적대적 손실을 조합한 것이다.

실험 결과

연구 질문

  • RQ1주파수 대역 간 복원 및 인지적 손실 최적화를 분리함으로써 이미지 복원에서 주파수 간 갈등을 줄일 수 있는가?
  • RQ2웨이블릿 기반 주파수 분해 방식이 공간 도메인 또는 DCT 기반 방법에 비해 구조적 및 텍스처 세부 정보를 얼마나 잘 유지하는가?
  • RQ3주파수 인식 정규화 체계는 다중 주파수 브랜치 간 특징 정렬 및 일관성을 향상시킬 수 있는가?
  • RQ4제안된 FRAN 모듈은 이미지 복원 과정에서 잡음과 세밀한 텍스처 세부 정보를 효과적으로 억제하고 유지하는가?
  • RQ5WaveFill은 다양한 마스크 유형을 가진 다양한 복원 벤치마크에서 최신 기술 수준의 방법을 얼마나 뛰어나게 성능을 내는가?

주요 결과

  • WaveFill은 비정규형 마스크를 가진 파리 스트리트뷰 검증 세트에서 FID 31.02를 기록하여 베이스라인(33.95)과 DCT 기반 모델(100.93)을 능가했다.
  • 동일한 벤치마크에서 PSNR 28.94와 SSIM 0.904를 기록하여 구조적 및 인지적 품질이 뛰어나다는 것을 입증했다.
  • 사용자 연구 결과, 파리 스트리트뷰에서는 68.0%, Places2에서는 72.0%, CelebA-HQ에서는 70.0%의 경우에서 WaveFill이 가장 현실적인 복원 결과로 평가되었으며, 경쟁 모델들을 크게 앞섰다.
  • 단절 실험 결과 웨이블릿 분해가 DCT 및 공간 도메인 기반 베이스라인 대비 성능 향상을 이끌어내었으며, FID는 DCT 기반 모델의 100.93에서 WaveFill + FRAN의 31.02로 감소했다.
  • FRAN 모듈은 시각적 비교를 통해 잡음 감소 및 의미 일관성 향상을 입증하였으며, GC, GMCNN 및 EC와 비교해 왜곡이 적고 더 선명한 텍스처를 생성했다.
  • 웨이블릿 분해와 FRAN의 조합은 특징 연결 기반의 베이스라인 모델 대비 FID에서 2.5% 향상되고 PSNR에서 0.5 dB 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.