[논문 리뷰] Learning Disentangling and Fusing Networks for Face Completion Under Structured Occlusions
이 논문은 쌍이 없는 훈련 데이터가 필요 없이 깨끗한 얼굴과 구조적인 가림을 분리하고 융합하는 새로운 생성적 적대적 네트워크인 DF-GAN을 제안한다. 얼굴 복구를 가림된 얼굴, 깨끗한 얼굴, 가림 요소의 세 도메인 간의 분리 및 융합 과정으로 모델링함으로써, 이중 학습 프레임워크와 도메인 특화 판별기, 인코더-디코더 네트워크를 사용하여 사진처럼 사실적인, 정체성을 유지하는 얼굴 복구 결과를 생성하며, 네 개의 Meshface 데이터베이스에서 최신 기술 수준의 성능을 달성한다.
Face completion aims to generate semantically new pixels for missing facial components. It is a challenging generative task due to large variations of face appearance. This paper studies generative face completion under structured occlusions. We treat the face completion and corruption as disentangling and fusing processes of clean faces and occlusions, and propose a jointly disentangling and fusing Generative Adversarial Network (DF-GAN). First, three domains are constructed, corresponding to the distributions of occluded faces, clean faces and structured occlusions. The disentangling and fusing processes are formulated as the transformations between the three domains. Then the disentangling and fusing networks are built to learn the transformations from unpaired data, where the encoder-decoder structure is adopted and allows DF-GAN to simulate structure occlusions by modifying the latent representations. Finally, the disentangling and fusing processes are unified into a dual learning framework along with an adversarial strategy. The proposed method is evaluated on Meshface verification problem. Experimental results on four Meshface databases demonstrate the effectiveness of our proposed method for the face completion under structured occlusions.
연구 동기 및 목표
- 구조적인 가림이 있는 상황에서 기존 방법이 쌍이 없는 데이터 부족과 가림의 구조 모델링 부족으로 실패하는 문제를 해결하기 위해.
- 단순한 이미지 보정이 아니라 깨끗한 얼굴과 가림 요소의 분리 및 융합 과정으로 얼굴 복구를 모델링하기 위해.
- 쌍이 없는 데이터를 사용하여, 가림된 얼굴, 깨끗한 얼굴, 구조적인 가림 요소의 세 도메인 간의 변환을 학습하는 프레임워크를 개발하기 위해.
- 메쉬 형태의 가림이 있는 조건에서 고품질의, 정체성을 유지하는 얼굴 복구 결과를 생성함으로써 얼굴 인식 성능을 향상시키기 위해.
- 이론적 일반화 능력을 입증하기 위해, 얼굴 복구를 넘어 스타일 전이 작업 등에의 잠재적 확장 가능성도 탐색하기 위해.
제안 방법
- 세 도메인을 구성한다: 가림된 얼굴(X), 깨끗한 얼굴(Y), 구조적인 가림(Z)으로서, 각각 다른 데이터 분포를 나타낸다.
- 분리 생성자 G는 가림된 얼굴을 잠재 표현으로 인코딩하고, 별도의 디코더를 사용하여 깨끗한 얼굴과 구조적인 가림 요소로 디코딩한다.
- 융합 생성자 F는 깨끗한 얼굴과 가림 요소의 잠재 표현을 연결하여 새로운 가림된 얼굴을 합성한다.
- 분리 및 융합 과정은 이중 학습 프레임워크 아래 통합되어 도메인 간 사이클 일致성(consistency)을 보장한다.
- 생성 샘플의 현실성 확보를 위해 도메인 특화 판별기(D_X, D_Y, D_Z)를 사용하여 적대적 훈련을 수행한다.
- 모델은 적대적 손실과 사이클 일치 손실을 사용하여 엔드 투 엔드로 훈련되며, 쌍이 없는 훈련 예제 없이도 생성이 가능하다.
실험 결과
연구 질문
- RQ1깨끗한 얼굴과 구조적인 가림 요소의 분리 및 융합 과정으로 얼굴 복구를 효과적으로 모델링할 수 있는가?
- RQ2쌍이 없는 훈련 데이터가 있더라도, GAN 기반 프레임워크가 깨끗한 얼굴과 가림 요소의 의미 있는 분리된 표현을 학습할 수 있는가?
- RQ3구조적인 가림 요소를 명시적으로 모델링하면 얼굴 복구 결과의 품질과 정체성 유지 능력이 향상되는가?
- RQ4학습된 표현이 가림 특징에 대한 벡터 산술 연산(예: 덧셈, 뺄셈)을 통해 의미 있는 작동을 지원하는가?
- RQ5제안된 방법이 구조적인 가림 조건 하에서 후속 얼굴 인식 성능을 향상시키는가?
주요 결과
- DF-GAN은 네 개의 Meshface 데이터베이스에서 최신 기술 수준의 성능을 달성하였으며, CycleGAN 등의 기준 방법보다 높은 PSNR 및 SSIM 점수를 기록하였다.
- AR, MultiPIE, Color FERET, LFW 데이터셋에서 다양한 표정과 조명 조건에서도 시각적으로 타당하고 정체성을 유지하는 얼굴 복구 결과를 생성하였다.
- 모델은 제약 없는 조건에서도 잘 일반화되어, LFW의 저해상도 및 큰 자세 이미지를 포함한 자연계 이미지의 얼굴 복구를 성공적으로 수행하였다.
- 제거 실험 결과, DF-GAN이 무작위 메쉬 패턴의 분포를 학습하고 있음을 확인하였으며, 예측 불가능한 가림 패턴을 성공적으로 분리함으로써 기억 저장이 아닌 분포 학습을 수행하고 있음을 입증하였다.
- 메쉬 표현에 대한 벡터 산술 연산은 제어 가능한 가림 합성 가능성을 보여주었으며, 보간은 중간 패턴을 생성하고 뺄셈은 비가림 영역을 노출함으로써 잠재 공간 내 선형적 특성을 나타내었다.
- 모든 데이터셋에서의 ROC 곡선은 DF-GAN이 복구 후 얼굴 인식 성능 향상에 효과적임을 검증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.