Skip to main content
QUICK REVIEW

[논문 리뷰] WINE: Wavelet-Guided GAN Inversion and Editing for High-Fidelity Refinement

Chaewon Kim, Seungjun Moon|arXiv (Cornell University)|2022. 10. 18.
Advanced Image and Video Retrieval Techniques인용 수 5
한 줄 요약

이 논문은 웨이블릿 기반 손실과 웨이블릿 융합 메커니즘을 도입하여 고주파 영상 세부 정보를 명시적으로 보존하는 웨이블릿 가이드 GAN 역행렬 방법 WaGI를 제안한다. 표준 $L_2$ 손실의 본질적 저주파 성향을 해결함으로써 WaGI는 영상 복원 및 편집 모두에서 최신 기술 수준(SOTA) 성능을 달성하여 가장자리 및 질감과 같은 세부 정보의 정밀도를 크게 향상시킨다.

ABSTRACT

Recent advanced GAN inversion models aim to convey high-fidelity information from original images to generators through methods using generator tuning or high-dimensional feature learning. Despite these efforts, accurately reconstructing image-specific details remains as a challenge due to the inherent limitations both in terms of training and structural aspects, leading to a bias towards low-frequency information. In this paper, we look into the widely used pixel loss in GAN inversion, revealing its predominant focus on the reconstruction of low-frequency features. We then propose WINE, a Wavelet-guided GAN Inversion aNd Editing model, which transfers the high-frequency information through wavelet coefficients via newly proposed wavelet loss and wavelet fusion scheme. Notably, WINE is the first attempt to interpret GAN inversion in the frequency domain. Our experimental results showcase the precision of WINE in preserving high-frequency details and enhancing image quality. Even in editing scenarios, WINE outperforms existing state-of-the-art GAN inversion models with a fine balance between editability and reconstruction quality.

연구 동기 및 목표

  • 고차원 특징의 고비율 조작에도 불구하고 기존 GAN 역행렬 모델이 고주파 영상 세부 정보를 보존하지 못하는 데서 기인하는 지속적인 실패 문제를 해결하기 위해.
  • 웨이블릿 도메인 분석을 통해 널리 사용되는 $L_2$ 손실이 GAN 역행렬에서 본질적으로 저주파 성분에 치우친 성향을 지닌다는 것을 규명하고 분석하기 위해.
  • 주파수 도메인 감독을 통해 고주파 부분대역을 명시적으로 다룰 수 있는 새로운 GAN 역행렬 프레임워크를 제안하기 위해.
  • 복원 정밀도와 편집 가능성 향상을 위해 복원 및 편집 과정에서 고주파 성분에 대한 정밀한 제어를 가능하게 하기 위해.

제안 방법

  • 고주파 부분대역(LH, HL, HH)에서의 복원 오차를 강조하는 웨이블릿 기반 손실 항목을 도입하여, 학습 중 고주파 부분대역의 보존을 우선시한다.
  • 계층적 업샘플링 과정에서 잠재 공간의 고주파 특징을 생성된 영상의 웨이블릿 계수에 직접 전달하는 웨이블릿 융합 메커니즘을 활용한다.
  • SWAGAN을 생성기 아키텍처로 사용하여 웨이블릿 기반 업샘플링을 내재적으로 지원하고 웨이블릿 계수의 명시적 조작을 가능하게 한다.
  • 입력 영상 및 재구성 영상의 저통과(LLL) 및 고통과(LH, HL, HH) 부분대역으로 분해하기 위해 이산 웨이블릿 변환(DWT)을 적용하여 주파수 인식 감독을 수행한다.
  • 잠재 차이($\Delta$)에 대한 $L_1$, 영상 복원($X$)에 대한 $L_2$, 고주파 계수에 대한 새로운 웨이블릿 손실을 조합한 다중 구성 요소 손실을 사용하여 인코더를 훈련시킨다.
  • 주파수 인식 감독을 통해 인코더와 생성기의 엔드 투 엔드 훈련을 실현하여, 복원에서 편집에 이르기까지 고주파 세부 정보가 보존되도록 보장한다.

실험 결과

연구 질문

  • RQ1고차원 특징을 사용하는 고비율 GAN 역행렬 모델들이 고주파 영상 세부 정보를 보존하지 못하는 이유는 무엇인가?
  • RQ2표준 $L_2$ 손실이 고주파 세부 정보를 희생하면서까지 저주파 성분 복원에 치우쳐지는 정도는 어느 정도인가?
  • RQ3웨이블릿 변환을 통한 명시적 주파수 도메인 감독이 세밀한 영상 세부 정보에 대해 GAN 역행렬의 정밀도를 향상시킬 수 있는가?
  • RQ4웨이블릿 융합은 잠재 공간에서 고주파 특징을 최종 영상 생성에 효과적으로 전달하는 데 어떻게 기여하는가?
  • RQ5제안된 웨이블릿 가이드 프레임워크는 최신 기술 수준(SOTA) 기반 모델에 비해 영상 복원 및 분리 가능한 편집 모두에서 뛰어난 성능을 유지하는가?

주요 결과

  • WaGI는 비교 모델 전부 중에서 가장 낮은 $L_2$ 복원 오차(0.015)와 가장 높은 SSIM(0.681)를 기록하여 영상 복원에서 HFGI 및 Restyle를 압도적으로 능가한다.
  • 웨이블릿 손실을 적용함으로써 $L_1$ 잠재 차이($\Delta$) 오차가 $L_1$만으로 훈련했을 때 대비 17% 감소하여, 잠재 공간의 정렬성이 향상됨을 나타낸다.
  • 웨이블릿 융합은 기준 모델 대비 $L_1$ 오차 7% 감소 및 $L_2$ 오차 40% 향상로 효과적인 고주파 전달이 이루어졌음을 입증한다.
  • 정성적 결과에서는 WaGI가 복원 및 편집 모두에서 손톱 색상, 문자 인쇄, 안경 프레임 등의 세부 정보를 기준 모델보다 훨씬 잘 보존하고 있음을 보여준다.
  • InterFaceGAN 및 StyleCLIP을 통한 편집 결과는 WaGI가 정체성과 세부 정보 일관성을 유지하며, HFGI 및 기타 기준 모델에서 흔히 발생하는 아티팩트와 정체성 이탈을 방지함을 확인한다.
  • 절단 실험 결과, 웨이블릿 손실과 웨이블릿 융합 모두가 필수적인 구성 요소임을 확인하였으며, 특히 웨이블릿 융합이 최종 복원 품질 향상에 가장 큰 기여를 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.