[논문 리뷰] LaFIn: Generative Landmark Guided Face Inpainting
LaFIn은 얼굴 랜드마크를 구조적 사전 지식으로 활용하여 현실성과 속성 일致성을 향상시키는 생성적 얼굴 보정 방법을 제안한다. 이는 두 개의 스트림으로 구성된 네트워크를 사용한다: 얼굴 구조와 표정을 추정하는 랜드마크 예측기와 예측된 랜드마크에 조건부로 작동하는 U-Net 기반 보정기로, CelebA-HQ와 CelebA에서 FID 점수 4.98(중앙 마스크 기준)과 5.31(랜덤 마스크 기준)을 기록하여 최신 기술 수준을 달성한다.
It is challenging to inpaint face images in the wild, due to the large variation of appearance, such as different poses, expressions and occlusions. A good inpainting algorithm should guarantee the realism of output, including the topological structure among eyes, nose and mouth, as well as the attribute consistency on pose, gender, ethnicity, expression, etc. This paper studies an effective deep learning based strategy to deal with these issues, which comprises of a facial landmark predicting subnet and an image inpainting subnet. Concretely, given partial observation, the landmark predictor aims to provide the structural information (e.g. topological relationship and expression) of incomplete faces, while the inpaintor is to generate plausible appearance (e.g. gender and ethnicity) conditioned on the predicted landmarks. Experiments on the CelebA-HQ and CelebA datasets are conducted to reveal the efficacy of our design and, to demonstrate its superiority over state-of-the-art alternatives both qualitatively and quantitatively. In addition, we assume that high-quality completed faces together with their landmarks can be utilized as augmented data to further improve the performance of (any) landmark predictor, which is corroborated by experimental results on the 300W and WFLW datasets.
연구 동기 및 목표
- 큰 손상, 다양한 자세, 표정, 신원 조건 하에서 현실적인 얼굴 보정 문제를 해결한다.
- 이전 방법들이 엣지 또는 파싱 맵에 의존하여 오류와 중복이 발생하기 쉬운 점을 해결한다.
- 보정된 얼굴의 구조적 정확성과 속성 일치성(예: 성별, 민족, 표정)을 향상시킨다.
- 예측된 랜드마크를 활용해 고품질로 생성된 얼굴이 랜드마크 검출 모델의 데이터 증강으로 효과적으로 활용될 수 있음을 입증한다.
- 기준 얼굴 데이터셋에서 정량적 및 정성적 평가 모두에서 뛰어난 성능을 달성한다.
제안 방법
- 두 단계의 딥러닝 프레임워크를 활용: 얼굴 랜드마크 예측 하위망과 조건부 이미지 보정 하위망.
- 확장된 잔차 블록과 장단기 주의 메커니즘을 갖춘 U-Net 기반 생성기로 장거리 공간적 의존성 간의 특징 집합을 향상시킨다.
- 예측된 랜드마크에 조건부로 보정기를 설계하여 의미적으로 일致하고 현실적인 얼굴 텍스처를 생성한다.
- 생성기 및 판별기 네트워크에 인스턴스 정규화와 스펙트럼 정규화를 통합하여 학습 안정성을 향상시킨다.
- 스펙트럼 정규화와 리키 ReLU를 적용한 다중 해상도 판별기를 사용하여 adversarial 손실 최적화를 향상시킨다.
- 300W와 WFLW에서 랜드마크 예측기의 보정을 위해 예측된 랜드마크를 기반으로 합성된 고품질 얼굴 보정 결과를 생성하여 데이터 증강을 수행한다.
실험 결과
연구 질문
- RQ1얼굴 랜드마크가 엣지 또는 파싱 맵보다 더 강건하고 효과적인 구조적 사전 지식이 될 수 있는가?
- RQ2예측된 랜드마크에 조건부로 보정 네트워크를 설계할 경우 현실성과 속성 일치성이 얼마나 향상되는가?
- RQ3정확한 랜드마크를 갖춘 고품질로 생성된 얼굴 보정 결과는 기존 랜드마크 검출 모델의 성능 향상에 활용될 수 있는가?
- RQ4다양한 손상 패턴 하에서 FID, LPIPS 및 정성적 품질 측면에서 최신 기술 수준의 방법들과 비교해 볼 때 본 방법은 어떻게 성능을 내는가?
- RQ5자세, 표정, 민족 등 다양한 얼굴 속성과 큰 손상 상황에서도 모델이 잘 일반화되는가?
주요 결과
- LaFIn은 중심 마스크 기준으로 CelebA-HQ에서 FID 점수 4.98을 기록하여 분포 유사성 측면에서 PIC 및 기타 최신 기술 수준 방법들을 능가한다.
- 랜덤 마스크 기준으로 FID 점수 5.31를 기록하여 비정규적인 손상 패턴에 대한 강력한 내성성을 입증한다.
- 정성적 결과에서 LaFIn은 눈, 코, 입과 같은 구조적 구조와 자세, 표정, 민족 등 속성 일치성을 기존 기준 방법보다 더 효과적으로 유지한다.
- 특히 큰 손상 영역에서 발생하는 구조적 불일치로 인한 정성적 결함을 크게 감소시킨다.
- 제안된 데이터 증강 전략은 300W와 WFLW에서 랜드마크 검출 성능을 향상시켜, 생성된 얼굴이 합성 학습 데이터로서의 유용성을 입증한다.
- 제거 실험 결과, 엣지나 파싱 맵 보다 랜드마크 조건부 학습이 더 효과적임을 확인하였으며, 이는 압축적이면서도 정보량이 풍부한 구조적 사전 지식을 제공하기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.