[논문 리뷰] Domain Embedded Multi-model Generative Adversarial Networks for Image-based Face Inpainting
이 논문은 변분 오토인코더 유도 잠재공간에 얼굴 특화 도메인 지식(예: 얼굴 마스크, 랜드마크, 부분 분할)을 통합하여 고품질의 이미지 기반 얼굴 복원을 위한 도메인 임bedded 다중모델 생성 대비 네트워크(DEGNet)를 제안한다. 이 방법은 구조적 일致성과 실사적 디테일을 보장하기 위해 전역 및 패치 수준의 생성 대비 손실을 사용하는 다중 판별자 설정을 채택하여 CelebA, CelebA-HQ에서 최고 성능을 기록하며, 특히 도전적인 측면 얼굴 복원에서 뛰어난 PSNR 및 SSIM 점수를 확보한다.
Prior knowledge of face shape and structure plays an important role in face inpainting. However, traditional face inpainting methods mainly focus on the generated image resolution of the missing portion without consideration of the special particularities of the human face explicitly and generally produce discordant facial parts. To solve this problem, we present a domain embedded multi-model generative adversarial model for inpainting of face images with large cropped regions. We firstly represent only face regions using the latent variable as the domain knowledge and combine it with the non-face parts textures to generate high-quality face images with plausible contents. Two adversarial discriminators are finally used to judge whether the generated distribution is close to the real distribution or not. It can not only synthesize novel image structures but also explicitly utilize the embedded face domain knowledge to generate better predictions with consistency on structures and appearance. Experiments on both CelebA and CelebA-HQ face datasets demonstrate that our proposed approach achieved state-of-the-art performance and generates higher quality inpainting results than existing ones.
연구 동기 및 목표
- 기존 이미지 복원 방법이 큰 또는 비정규적인 영역에서 구조적으로 일관되고 현실적인 얼굴 성분을 생성하는 데 한계를 보이는 문제를 해결하기 위해.
- 인간 얼굴의 구조에 대한 사전 지식(예: 대칭성, 부분 간 관계, 랜드마크 등)을 생성 과정에 명시적으로 통합하기 위해.
- 기존 방법이 부족한 부족하거나 모호한 얼굴 단서로 인해 실패하는 경우가 많은 측면 얼굴 복원과 같은 도전적인 케이스에서 성능을 향상시키기 위해.
- 전역 공간 일관성과 국소 텍스처 현실감을 동시에 향상시키는 통합 프레임워크를 개발하기 위해.
제안 방법
- 변분 오토인코더를 기반으로 한 잠재공간에 얼굴 특화 도메인 정보(마스크, 랜드마크, 부분 분할)를 인코딩하여 생성자에 대한 구조적 사전 지식을 형성한다.
- 생성자는 이 도메인 임베딩된 잠재 코드와 비얼굴 영역 특징을 통합하여 구조적 일관성과 외관이 일관된 고해상도 얼굴 이미지를 합성한다.
- 이중 판별자 아키텍처를 사용한다: 전역 판별자는 전체적인 공간 일관성을 보장하고, 패치 수준 판별자는 국소 텍스처 현실감과 세밀한 디테일을 향상시킨다.
- 재구성 손실, 전역 생성 대비 손실, 패치 수준 생성 대비 손실을 결합한 훈련 프레임워크를 통해 정밀도와 현실감을 최적화한다.
- 생성자와 판별자 간의 교차 최적화 방식으로 모델을 훈련시키며, 성분 기여도를 검증하기 위한 아블레이션 스터디를 실시한다.
- 정면 및 측면 얼굴 복원 모두에서 평가하여, 비정규적이고 큰 손실 영역에 대해서도 강건함을 입증한다.
실험 결과
연구 질문
- RQ1특정 얼굴 도메인 지식(예: 랜드마크, 마스크, 부분 레이블 등)을 명시적으로 임베딩함으로써 이미지 복원에서 생성된 얼굴 성분의 구조적 현실감을 향상시킬 수 있는가?
- RQ2전역 및 패치 수준의 생성 대비 판별자를 조합한 방식이 단일 판별자 접근 방식에 비해 생성된 얼굴 이미지의 품질과 일관성에 어떤 영향을 미치는가?
- RQ3제안된 방법은 얼굴 대칭성과 특징 가시성이 크게 감소한 측면 얼굴 복원과 같은 도전적인 케이스로 일반화될 수 있는가?
- RQ4PSNR 및 SSIM로 측정했을 때, 각 성분(재구성, 전역, 패치 판별자)이 최종 성능에 기여하는 정도는 어떠한가?
- RQ5도메인 임베딩된 잠재 변수를 사용할 경우, 명시적인 구조적 사전 지식 없이 직접 학습하는 GAN에 비해 더 조화롭고 아티팩트가 적은 결과를 얻을 수 있는가?
주요 결과
- CelebA 및 CelebA-HQ 데이터셋에서 DEGNet은 정상적인 큰 구멍 영역에서 PSNR 27.97, SSIM 0.926을 기록하며 기존 방법을 능가하는 최고 수준의 성능을 달성한다.
- 측면 얼굴 복원에 있어서 DEGNet은 PSNR 25.36, SSIM 0.886을 기록하며, 이는 다음으로 우수한 방법(PM)의 PSNR 24.44, SSIM 0.873을 크게 능가한다.
- 아블레이션 스터디는 재구성, 전역, 패치 판별자를 모두 조합할 경우 최고의 성능(PSNR: 26.208, SSIM: 0.895)을 기록하며, 특히 패치 판별자가 국소 디테일 향상에 핵심 기여를 한다는 것을 확인한다.
- 정성적 결과에서는 DEGNet이 대칭적이고 현실적인 얼굴 특징(예: 일치하는 눈 크기 및 색상)을 생성하여 기존 방법에서 흔히 발생하는 비대칭성과 흐림을 방지한다.
- 비정규적인 모양의 손실 영역에 대해서도 모델이 잘 일반화되어 높은 시각적 품질과 구조적 일관성을 유지함을 그림 5를 통해 입증한다.
- 도메인 임bedded된 잠재 변수의 포함은 특히 큰 손실 영역에서 구조적 일관성을 크게 향상시켜 아티팩트를 감소시키고 인지적 품질을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.