[논문 리뷰] Global and Local Consistent Wavelet-domain Age Synthesis
이 논문은 파형도메인에서 전반적인 얼굴 구조와 국소적인 질감 세부 정보를 모델링함으로써 연령 진전 또는 역진행된 얼굴을 합성하는 새로운 생성적 적대적 네트워크인 WaveletGLCA-GAN을 제안한다. 전역 및 국소 네트워크를 파형 기반 주파수 표현과 다섯 가지 전문화된 손실 함수와 통합함으로써, CACD2000, Morph, FG-NET 데이터셋에서 최신 기술 대비 뛰어난 사진 실사성과 연령 정확도를 달성한다.
Age synthesis is a challenging task due to the complicated and non-linear transformation in human aging process. Aging information is usually reflected in local facial parts, such as wrinkles at the eye corners. However, these local facial parts contribute less in previous GAN based methods for age synthesis. To address this issue, we propose a Wavelet-domain Global and Local Consistent Age Generative Adversarial Network (WaveletGLCA-GAN), in which one global specific network and three local specific networks are integrated together to capture both global topology information and local texture details of human faces. Different from the most existing methods that modeling age synthesis in image-domain, we adopt wavelet transform to depict the textual information in frequency-domain. %Moreover, to achieve accurate age generation under the premise of preserving the identity information, age estimation network and face verification network are employed. Moreover, five types of losses are adopted: 1) adversarial loss aims to generate realistic wavelets; 2) identity preserving loss aims to better preserve identity information; 3) age preserving loss aims to enhance the accuracy of age synthesis; 4) pixel-wise loss aims to preserve the background information of the input face; 5) the total variation regularization aims to remove ghosting artifacts. Our method is evaluated on three face aging datasets, including CACD2000, Morph and FG-NET. Qualitative and quantitative experiments show the superiority of the proposed method over other state-of-the-arts.
연구 동기 및 목표
- GAN 기반 방법에서 주름과 같은 국소 질감 세부 정보의 손실 문제를 해결하기 위해 세밀한 연령 합성을 다루는 것.
- 이미지 도메인 처리에만 의존하지 않고 파형 변환을 이용해 주파수 도메인에서 노화 패턴을 모델링하여 연령 합성 성능을 향상시키는 것.
- 정확한 연령 관련 얼굴 변화를 생성하면서도 신원과 배경 정보를 유지하는 것.
- 기존 GAN 기반 연령 합성 모델에서 흔히 발생하는 과도한 부드러움과 가짜 영역 아티팩트를 줄이는 것.
- 다양한 연령 범위와 영상 품질을 가진 다양한 데이터셋에서 일관되고 현실적인 연령 진전/역진행을 달성하는 것.
제안 방법
- 이 방법은 입력 얼굴를 파형 하위밴드로 분해하여 다중 척도 특징 학습을 위한 파형 도메인 전역 및 국소 일致 연령 생성자(WaveletGLCA-G)를 사용한다.
- 전체 구조적 특징과 세밀한 질감 세부 정보를 캡처하기 위해 전역 전용 네트워크 하나와 이마, 눈, 입에 대한 세 개의 국소 전용 네트워크를 사용한다.
- 잔여 파형 계수를 예측하기 위한 파형 계수 예측 네트워크를 도입하여 수렴 속도 향상과 더불어 더 나은 신원 유지 성능을 달성한다.
- 다섯 가지 손실 함수를 적용한다: 실사성 확보를 위한 적대적 손실, 일관성 유지를 위한 신원 유지 손실, 정확도 확보를 위한 연령 유지 손실, 배경 충실도 확보를 위한 픽셀 단위 손실, 아티팩트 억제를 위한 총 변동성(TV) 정규화.
- 판별자는 실제 목표 연령의 얼굴와 생성된 얼굴를 구별하도록 훈련되어, 적대적 훈련을 통해 사진 실사성을 강화한다.
- 모델은 연령 레이블을 조건부 입력으로 사용하여 엔드 투 엔드로 훈련되며, 제어 가능한 연령 진전 또는 역진행을 가능하게 한다.
실험 결과
연구 질문
- RQ1이미지 도메인 GAN과 비교해 파형 도메인에서의 노화 모델링이 합성 얼굴의 정밀도와 질감 세부 정보 향상에 기여하는가?
- RQ2눈, 이마, 입과 같은 핵심 얼굴 영역에 대해 국소 전용 네트워크를 통합함으로써 연령 관련 질감 변화의 캡처가 어떻게 향상되는가?
- RQ3파형 기반 표현 방식이 신원 유지 및 아티팩트 감소에 얼마나 기여하는가?
- RQ4파형 도메인 연령 합성에서 총 변동성 정규화를 사용할 경우 실사성과 아티팩트 억제 사이의 최적의 트레이드오프는 무엇인가?
- RQ5제안된 방법은 다양한 연령 범위와 영상 품질을 가진 다양한 데이터셋에서 어떻게 성능을 발휘하는가?
주요 결과
- WaveletGLCA-GAN은 CACD2000, Morph, FG-NET 데이터셋에서 정성적 및 정량적 평가에서 최신 기술 수준의 성능을 달성한다.
- 표 III 및 IV에서 보듯이, GLCA-GAN 및 Wavelet-GAN과 비교해 연령 정확도가 뚜렷이 향상됨을 입증한다.
- 시각적 비교 결과, WaveletGLCA-GAN은 눈 주변과 이마와 같이 연령 민감도가 높은 영역에서 더 현실적인 질감을 생성함을 보여준다.
- 파형 계수 예측 네트워크는 과도한 부드러움을 줄이고 세밀한 질감 합성을 향상시켜 더 선명하고 세밀한 결과를 도출한다.
- Figure 16에서 보듯이, TV 손실에 대한 트레이드오프 파rameter로 0.0001을 사용할 경우 아티팩트 감소와 질감 유지 사이의 최적 균형을 이룬다.
- 복잡한 노화 패턴이 있는 도전적인 케이스에서도 신원과 배경 정보를 성공적으로 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.