Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Techniques for GAN based Facial Inpainting

Avisek Lahiri, Arnav Jain|arXiv (Cornell University)|2018. 10. 20.
Generative Adversarial Networks and Image Synthesis참고 문헌 16인용 수 8
한 줄 요약

이 논문은 재건 품질과 최적화 속도를 향상시키기 위해 유연한 매개변수화 네트워크를 사용해 더 나은 초기화를 하고, 영상 시퀀스에 대해 시간적 스무스니스 손실을 적용하는 GAN 기반 얼굴 복원 방법을 제안한다. CelebA 및 VidTIMIT 데이터셋에서 상태기반 모델보다 명시적 얼굴 인식 감독 없이도 15배 이상의 속도 향상과 뛰어난 신원 유지 성능을 달성한다.

ABSTRACT

In this paper we present several architectural and optimization recipes for generative adversarial network(GAN) based facial semantic inpainting. Current benchmark models are susceptible to initial solutions of non-convex optimization criterion of GAN based inpainting. We present an end-to-end trainable parametric network to deterministically start from good initial solutions leading to more photo realistic reconstructions with significant optimization speed up. For the first time, we show how to efficiently extend GAN based single image inpainter models to sequences by a)learning to initialize a temporal window of solutions with a recurrent neural network and b)imposing a temporal smoothness loss(during iterative optimization) to respect the redundancy in temporal dimension of a sequence. We conduct comprehensive empirical evaluations on CelebA images and pseudo sequences followed by real life videos of VidTIMIT dataset. The proposed method significantly outperforms current GAN based state-of-the-art in terms of reconstruction quality with a simultaneous speedup of over 15$ imes$. We also show that our proposed model is better in preserving facial identity in a sequence even without explicitly using any face recognition module during training.

연구 동기 및 목표

  • 단일 이미지 설정에서 비볼록 최적화로 인한 GAN 기반 얼굴 복원의 불안정성과 수렴 불량 문제를 해결하기 위해.
  • 시간 역동성을 모델링하고 일致성을 강제함으로써 단일 이미지 GAN 기반 복원을 영상 시퀀스로 확장하기 위해.
  • 학습 중에 명시적 얼굴 인식 모듈에 의존하지 않고도 재건 품질과 최적화 속도를 향상시키기 위해.
  • 시간적 스무스니스 손실만으로도 시퀀스 전반에 걸쳐 얼굴 신원을 효과적으로 유지할 수 있는지 입증하기 위해.
  • VidTIMIT와 같은 진짜 얼굴 영상 데이터셋과 가짜 시퀀스 데이터셋 모두에서 방법의 유효성을 검증하기 위해.

제안 방법

  • 랜덤 초기화를 대체하여 잠재 코드 $ z $ 를 결정적으로 초기화할 수 있는 학습 가능한 매개변수화 네트워크를 제안하여, 초기 재건 품질을 향상시킨다.
  • 시나리오 역동성을 캡처하기 위해 시간 창 내 프레임 간 잠재 코드를 함께 초기화하기 위해 순환 신경망(LSTM)을 도입한다.
  • 이웃 프레임의 최종 최적화된 잠재 코드가 유클리드 공간에서 유사하도록 제약을 두는 시간적 스무스니스 손실을 구현한다.
  • 사전 훈련된 GAN 생성자와 판별자를 사용해 인지적 손실과 맥락적 손실을 계산하고, 이 손실들의 가중치 합으로 최적화를 이끌어낸다.
  • 잠재 코드 $ z $ 를 개선하기 위해 최적화 프레임워크를 반복적으로 적용하며, $ L_{con}(z|I_d,M) + \eta L_{per}(z) $ 를 최소화한다. 새로운 구성 요소들이 수렴을 향상시킨다.
  • 실제 저해상도, 현실 세계의 얼굴 영상 분포에 적합하도록, 사전 훈련된 CelebA GAN을 VidTIMIT 데이터에 대해 미세조정한다.

실험 결과

연구 질문

  • RQ1랜덤 초기화에 비해 학습 가능한 매개변수화 초기화가 GAN 기반 얼굴 복원의 품질과 속도를 향상시킬 수 있는가?
  • RQ2다중 프레임 영상 시퀀스에서 잠재 코드를 초기화하는 데 순환 신경망이 효과적으로 사용될 수 있는가?
  • RQ3명시적 신원 감독 없이도 반복 최적화 중 시간적 스무스니스 손실이 영상 복원에서 얼굴 신원 유지에 기여하는가?
  • RQ4제안된 구성 요소들은 실제 영상 데이터에서 어떻게 성능을 내며, 합성 가짜 시퀀스를 초월해 일반화 가능한가?
  • RQ5학습 가능한 초기화와 시간적 스무스니스 손실의 조합이 재건 품질과 최적화 속도에서 최신 기술을 초월하는 정도는 어느 정도인가?

주요 결과

  • 제안된 방법은 CelebA 및 VidTIMIT 데이터셋에서 기준 모델 [7] 대비 평균 최적화 속도 향상이 15배 이상 달성된다.
  • 128×128 해상도에서 VidTIMIT 데이터셋의 fjas0 주제에 대해 제안 모델(LSTM init + Smoothness Loss)은 평균 PSNR 27.78 dB를 달성했으며, [7]은 25.81 dB였다.
  • 128×128 해상도에서 맥락적 손실은 0.41에서 0.23으로 감소하고, 인지적 손실은 0.20에서 0.11로 감소하여 더 나은 재건과 현실성 향상을 나타낸다.
  • 128×128 해상도에서 FaceNet 손실은 0.68에서 0.23으로 감소하여 얼굴 신원 유지 측면에서 뚜렷한 향상이 있었다.
  • 시간적 스무스니스 손실만으로도 명시적 신원 감독을 사용하는 모델와 유사한 수준의 신원 유지 성능을 달성하여, 암묵적 신원 모델링에서의 효과성을 입증했다.
  • 가짜 시퀀스와 실제 영상 모두에서 [7]보다 시각적 품질이 뛰어나며, 정성적 결과는 더 사진처럼 현실감 있고 시간적으로 일관된 출력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.