Skip to main content
QUICK REVIEW

[논문 리뷰] r-BTN: Cross-domain Face Composite and Synthesis from Limited Facial Patches

Yang Song, Zhifei Zhang|arXiv (Cornell University)|2017. 06. 02.
Face recognition and analysis참고 문헌 33인용 수 4
한 줄 요약

이 논문은 얼굴과 스케치 도메인 간의 순환적 양방향 변환을 통해, 최대 95%의 부족한 영역이 있는 제한된 얼굴 패치로부터도 고해상도이고 현실적인 얼굴 이미지나 스케치를 생성하는 r-BTN을 제안한다. 이는 전방 및 후방 도메인 변환을 반복적으로 적용하여 재구성을 정밀하게 개선함으로써 기존 방법에 비해 더 뛰어난 일관성과 낮은 흐림을 달성한다.

ABSTRACT

We start by asking an interesting yet challenging question, "If an eyewitness can only recall the eye features of the suspect, such that the forensic artist can only produce a sketch of the eyes (e.g., the top-left sketch shown in Fig. 1), can advanced computer vision techniques help generate the whole face image?" A more generalized question is that if a large proportion (e.g., more than 50%) of the face/sketch is missing, can a realistic whole face sketch/image still be estimated. Existing face completion and generation methods either do not conduct domain transfer learning or can not handle large missing area. For example, the inpainting approach tends to blur the generated region when the missing area is large (i.e., more than 50%). In this paper, we exploit the potential of deep learning networks in filling large missing region (e.g., as high as 95% missing) and generating realistic faces with high-fidelity in cross domains. We propose the recursive generation by bidirectional transformation networks (r-BTN) that recursively generates a whole face/sketch from a small sketch/face patch. The large missing area and the cross domain challenge make it difficult to generate satisfactory results using a unidirectional cross-domain learning structure. On the other hand, a forward and backward bidirectional learning between the face and sketch domains would enable recursive estimation of the missing region in an incremental manner (Fig. 1) and yield appealing results. r-BTN also adopts an adversarial constraint to encourage the generation of realistic faces/sketches. Extensive experiments have been conducted to demonstrate the superior performance from r-BTN as compared to existing potential solutions.

연구 동기 및 목표

  • 최대 95%의 영역이 손실된 작은 얼굴 패치에서 현실적이고 고해상도의 얼굴 이미지를 생성하는 데 도전하는 것.
  • 패치 기반 매칭 및 인painting 기반 기존 방법이 큰 손실 영역에서 블러와 낮은 일관성 문제를 겪는 점을 극복하는 것.
  • 얼굴과 스케치의 다양체 간의 상호작용을 활용하여 얼굴/스케치 합성에서의 도메인 간 일관성과 사진 유사성을 향상시키는 것.
  • 다양한 개인의 패치를 통합적으로 생성하고 일관되게 융합함으로써 강력한 얼굴 복합 이미지 생성을 가능하게 하는 것.

제안 방법

  • 얼굴 도메인과 스케치 도메인 간을 번갈아가며 매핑하는 양방향 변환 네트워크(BTN)를 사용한 순환적 생성 프레임워크를 제안한다.
  • 재귀적 정밀화 과정을 안정화하고 현실적, 고해상도 출력으로 수렴하도록 전방 및 후방 오차 최소화 기법을 도입한다.
  • 생성된 이미지의 사진 유사성과 인지적 품질을 향상시키기 위해 얼굴 → 스케치 및 스케치 → 얼굴 네트워크에서 적대적 훈련을 시행한다.
  • 다양한 패치 간 생성된 얼굴의 유사성과 다양성을 평가하기 위해 사전 훈련된 VGG-Face 네트워크를 활용해 고수준 특징을 추출한다.
  • 반복적 정밀화를 적용: 각 단계에서 현재 재구성 이미지를 도메인 간 전후로 매핑하여 잔차 오차를 점진적으로 감소시킨다.
  • 실제 이미지가 저차원 다양체 위에 존재한다고 가정하고, 얼굴과 스케치 도메인의 다양체 구조를 활용하여 재귀적 생성 과정을 현실적인 해답으로 유도한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델은 최소한의 얼굴 패치(예: 5%만 노출)에서 최대 95%의 영역이 손실된 경우에도 현실적이고 고해상도의 얼굴 이미지를 생성할 수 있는가?
  • RQ2얼굴과 스케치 도메인 간의 양방향 도메인 변환은 큰 손실 영역에서 이미지 생성의 일관성 향상과 블러 감소에 어떻게 기여하는가?
  • RQ3전방 및 후방 오차 최소화를 통한 재귀적 정밀화는 생성 과정의 안정성과 수렴 성능을 얼마나 향상시키는가?
  • RQ4동일 또는 다른 개인의 패치에서 생성된 얼굴 이미지가 신원 일관성(내부 클래스 유사성)과 다양성(외부 클래스 차이)을 얼마나 잘 유지하는가?
  • RQ5r-BTN은 pix2pix 및 인painting 기반 접근법과 비교해 복원 정확도, 현실성, 극한의 손실 영역에서의 내구성 측면에서 어떤 성능을 보이는가?

주요 결과

  • r-BTN은 약 20회의 반복 후 안정적인 수렴을 보이며, 평균 잔차는 0에 가까워지고 평균 절대 잔차는 작은 값으로 안정화되어 일관성 있고 신뢰할 수 있는 생성을 의미한다.
  • 95%의 이미지가 손실된 경우에도 r-BTN은 pix2pix 및 인painting 기반 기준선 방법보다 시각적 품질과 복원 정확도에서 뛰어난 성능을 보이며 블러를 크게 감소시킨다.
  • 동일한 사람의 패치(예: 왼쪽 눈, 오른쪽 눈)에서 생성된 얼굴은 높은 내부 클래스 유사성을 보이며, 다른 사람의 패치에서 생성된 얼굴은 강한 외부 클래스 다양성을 나타낸다. 특히 손실 비율이 낮을수록(≤60%) 두드러진다.
  • 동일한 사람의 눈 패치에서 생성된 얼굴 간의 유사도는 코나 입술 패치에서 생성된 얼굴보다 높으며, 이는 모델이 신원 정보를 효과적으로 유지함을 반영한다.
  • 95% 손실 비율에서 유사도와 다양성 곡선이 교차함으로써 신원 유지 능력이 떨어지는 것을 확인하였고, 이는 매우 작은 패치에서 신뢰할 수 있는 생성의 실질적 한계를 시사한다.
  • 적대적 제약은 사진 유사성을 효과적으로 향상시키며, 양방향 학습 메커니즘은 단방향 접근보다 더 정확한 기하학적 구조 복원을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.