[논문 리뷰] Texture Deformation Based Generative Adversarial Networks for Face Editing
이 논문은 DAE 기반 인코더를 사용해 얼굴 텍스처를 변형에서 분리하고, 이후 공간 변형을 통해 텍스처를 다시 적용함으로써 표정, 성별, 연령 등 목표 속성을 텍스처에서 이미지로의 변환을 통해 전달하는 TDB-GAN이라는 새로운 얼굴 편집 프레임워크를 제안한다. 이 방법은 CelebA 및 RaFD 데이터셋에서 기존의 GAN 기반 얼굴 편집 모델보다 뛰어난 시각적 품질, 더 선명한 디테일, 더 나은 신원 유지 성능을 달성한다.
Despite the significant success in image-to-image translation and latent representation based facial attribute editing and expression synthesis, the existing approaches still have limitations in the sharpness of details, distinct image translation and identity preservation. To address these issues, we propose a Texture Deformation Based GAN, namely TDB-GAN, to disentangle texture from original image and transfers domains based on the extracted texture. The approach utilizes the texture to transfer facial attributes and expressions without the consideration of the object pose. This leads to shaper details and more distinct visual effect of the synthesized faces. In addition, it brings the faster convergence during training. The effectiveness of the proposed method is validated through extensive ablation studies. We also evaluate our approach qualitatively and quantitatively on facial attribute and facial expression synthesis. The results on both the CelebA and RaFD datasets suggest that Texture Deformation Based GAN achieves better performance.
연구 동기 및 목표
- 기존의 GAN 기반 얼굴 편집 방법에서의 한계, 즉 낮은 디테일 선명도, 약한 속성 전달, 신원 일관성 부족 문제를 해결하기 위해.
- 얼굴 텍스처를 변형에서 분리하고, 텍스처를 속성 전달의 주요 매체로 사용하여 자세 및 형태에 대한 의존도를 줄이기 위해.
- 직접적인 이미지 간 번역 대신 텍스처 기반 이미지 합성을 활용하여 학습 수렴도 향상 및 시각적 품질 향상을 위해.
- 입력 이미지와 생성된 이미지 간의 전용 신원 손실을 적용하여 편집 중에도 신원 유지 성능을 강화하기 위해.
- 얼굴 속성 및 표정 편집에서 이미지 간 번역 대비 텍스처 기반 이미지 번역의 우수성을 검증하기 위해.
제안 방법
- 해당 방법은 변형 가능한 오토인코더(DAE)를 사용하여 입력 이미지를 음영, 알베도, 변형 성분으로 분해하고, 음영과 알베도를 조합하여 깔끔하고 정렬된 텍스처 이미지를 생성한다.
- 생성된 텍스처와 목표 도메인 레이블(예: 성별, 표정)을 조건으로 하는 GAN 생성자로 목표 속성을 가진 새로운 텍스처를 합성한다.
- 합성된 텍스처는 원래의 공간적 변형을 기반으로 다시 왜곡되어 최종 얼굴 이미지를 재구성하며 기하학적 구조를 유지한다.
- 입력 이미지와 생성된 이미지 간의 신원 손실을 적용하여 편집 과정에서의 신원 유지 성능을 강화한다.
- 모델은 적대적 손실, L1 재구성 손실, 신원 손실을 사용하여 현실성과 일관성을 확보하는 방식으로 훈련된다.
- 텍스처 공간에서의 분리 표현을 학습함으로써 다중 도메인 얼굴 편집(예: 표정, 성별, 연령)이 가능해진다.
실험 결과
연구 질문
- RQ1텍스처를 변형에서 분리하면 얼굴 편집 작업에서 생성된 얼굴의 품질과 현실감이 향상되는가?
- RQ2직접적인 이미지 간 번역 대비 텍스처 기반 이미지 번역이 속성 전달 및 더 선명한 얼굴 디테일을 제공하는가?
- RQ3텍스처 기반 GAN 프레임워크에 신원 손실을 도입함으로써 신원 유지 성능을 크게 향상시킬 수 있는가?
- RQ4TDB-GAN은 StarGAN, CycleGAN, IcGAN 등의 최신 모델과 비교하여 정성적 및 정량적 평가에서 어떻게 성능을 내는가?
- RQ5분리된 텍스처 표현은 모델이 구분 가능한 얼굴 표정을 합성하는 데 능력을 향상시키는가?
주요 결과
- 사용자 연구에서 TDB-GAN은 스마일 전달에 대해 57.33%의 가장 높은 지각 투표율을 기록했으며, 연령 전달에 대해서는 62.00%를 기록하여 IcGAN, CycleGAN, StarGAN을 모두 앞섰다.
- RaFD 데이터셋에서 TDB-GAN이 생성한 이미지는 얼굴 표정 분류 정확도가 97.28%를 기록하여 IcGAN(91.61%), CycleGAN(88.44%), StarGAN(92.06%)보다 유의미하게 높았다.
- TDB-GAN은 눈 주변 영역에서 특히 선명한 얼굴 디테일과 더불어 분명한 표정(예: 분노, 공포)을 표현해 StarGAN 및 기타 기준 모델보다 뛰어난 성능을 보였다.
- 사용자 연구 결과, TDB-GAN이 경쟁 모델 대비 더 뛰어난 현실감, 속성 품질, 신원 유지 성능을 가진 이미지를 생성하는 것으로 확인되었다.
- 절단 실험 결과, 텍스처 기반 번역과 신원 손실이 성능 향상에 필수적임을 입증했으며, 특히 신원 일관성 향상에 기여했다.
- TDB-GAN은 텍스처 공간에서의 분리 표현 덕분에 더 빠른 학습 수렴도와 여러 도메인에 걸친 더 나은 일반화 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.