[논문 리뷰] Frequency Domain Image Translation: More Photo-realistic, Better Identity-preserving
이 논문은 저주파수 및 고주파수 성분으로 이미지를 분해하여 신원 보존과 사진처럼 현실적인 품질을 햖스키는 GAN 기반의 새로운 프레임워크인 주파수 도메인 이미지 변환(FDIT)을 제안한다. 픽셀 공간과 푸리에 스펙트럼 공간 양쪽에서 일관성을 강제함으로써 FDIT는 이전 최고 성능 방법 대비 FID 점수를 5.6% 향상시켜 신원 보존과 시각적 품질을 크게 향상시킨다.
Image-to-image translation has been revolutionized with GAN-based methods. However, existing methods lack the ability to preserve the identity of the source domain. As a result, synthesized images can often over-adapt to the reference domain, losing important structural characteristics and suffering from suboptimal visual quality. To solve these challenges, we propose a novel frequency domain image translation (FDIT) framework, exploiting frequency information for enhancing the image generation process. Our key idea is to decompose the image into low-frequency and high-frequency components, where the high-frequency feature captures object structure akin to the identity. Our training objective facilitates the preservation of frequency information in both pixel space and Fourier spectral space. We broadly evaluate FDIT across five large-scale datasets and multiple tasks including image translation and GAN inversion. Extensive experiments and ablations show that FDIT effectively preserves the identity of the source image, and produces photo-realistic images. FDIT establishes state-of-the-art performance, reducing the average FID score by 5.6% compared to the previous best method.
연구 동기 및 목표
- GAN 기반의 이미지 간 번역에서 참조 도메인에 과도하게 적응하여 발생하는 신원 보존 문제를 해결하기 위해.
- 기존 방법에서 손실되는 세밀한 구조적 세부 정보를 보존함으로써 사진처럼 현실적인 품질을 향상시키기 위해.
- 픽셀 공간과 스펙트럼 공간 양쪽에서 주파수 일관성을 명시적으로 강제하는 학습 프레임워크를 개발하기 위해.
- 이미지 번역 및 GAN 역전환을 포함한 다양한 데이터셋과 작업에 대해 효과성을 입증하기 위해.
- 주파수 도메인 분석을 이미지 생성 작업에 실현 가능하고 강력한 패러다임으로 정립하기 위해.
제안 방법
- FDIT는 가우시안 저통과 필터를 사용하여 입력 이미지를 저주파수(색상/일조) 성분과 고주파수(윤곽/세부 정보) 성분으로 분해한다.
- 픽셀 공간 손실은 원본 이미지와 생성된 이미지의 고주파수 성분 간 유사성을 강제한다.
- 푸리에 스펙트럼 손실은 이미지에 대해 빠른 푸리에 변환(FFT)을 계산하여 고주파수 스펙트럼 일관성을 확보한다.
- 이 프레임워크는 조건부 GAN 또는 오토에인코더 아키텍처에 주파수 감시를 통합하여 엔드 투 엔드 학습을 가능하게 한다.
- 이미지 재구성 및 이미지 번역 단계 모두에서 주파수 기반 정규화가 적용된다.
- 학습을 안정화하고 정밀도를 향상시키기 위해 적대적 손실, 사이클 일관성 손실, 주파수 기반 손실의 조합으로 학습된다.
실험 결과
연구 질문
- RQ1주파수 도메인 정규화는 사진처럼 현실적인 품질을 훼손하지 않고도 이미지 간 번역에서 신원 보존을 향상시킬 수 있는가?
- RQ2픽셀 공간과 스펙트럼 공간 양쪽에서 고주파수 일관성을 강제할 경우 시각적 품질과 구조적 정밀도에 어떤 영향을 미치는가?
- RQ3FID 점수와 신원 및 현실감에 대한 사용자 선호도 측면에서 FDIT는 기존 GAN 기반 방법보다 어느 정도 뛰어나게 성능을 발휘하는가?
- RQ4FDIT는 GAN 역전환 및 크로스 도메인 번역을 포함한 다양한 데이터셋과 작업에 일반화될 수 있는가?
- RQ5픽셀 공간 주파수 감시와 스펙트럼 공간 주파수 감시 중 어느 것이 번역 품질 향상에 더 기여하는가?
주요 결과
- FDIT는 이전 최고 성능 방법 대비 평균 FID 점수를 5.6% 향상시켜 뛰어난 이미지 품질을 입증했다.
- 사용자 연구 결과, FDIT는 신원 보존에서 SwapAE 대비 75.40%의 선호도를 기록했고, 이미지 품질에서는 64.39%의 선호도를 기록했다.
- 픽셀 공간의 고주파수 성분은 개체의 구조와 신원 보존에 핵심적이며, 제거 실험을 통해 이를 검증했다.
- FFT 손실에 의한 스펙트럼 일관성은 세밀한 세부 정보 유지에 크게 기여하며 고주파수 왜곡을 감소시킨다.
- FDIT는 새로 수집한 두 개를 포함한 다섯 개의 대규모 데이터셋에서 여러 작업에 걸쳐 잘 일반화됨을 보였다.
- 제거 실험 결과, 최적의 성능을 위해 픽셀 공간과 스펙트럼 공간 주파수 감시가 모두 필요하다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.