Skip to main content
QUICK REVIEW

[논문 리뷰] GazeCorrection:Self-Guided Eye Manipulation in the wild using Self-Supervised Generative Adversarial Networks

Jichao Zhang, Meng Sun|arXiv (Cornell University)|2019. 06. 03.
Image Processing Techniques and Applications참고 문헌 28인용 수 8
한 줄 요약

이 논문은 라벨이 없는 머리 자세나 눈의 각도 데이터가 필요 없는, 자기지도 학습 기반의 생성적 적대적 네트워크인 GazeGAN을 제안한다. 이는 이미지 복원 프레임워크를 기반으로 하며, 실외(인드어와일드) 이미지에서 시선 교정을 수행한다. 방법은 신원 유지에 도움이 되는 각도에 영향을 받지 않는 특징을 추출하기 위해 사전 학습된 자기지도 모델을 사용하고, 훈련의 안정성과 현실성 향상을 위해 자기지도 모듈을 도입한다. 이로 인해 실외 데이터셋에서 정성적, 정량적으로 최고의 성능을 달성한다.

ABSTRACT

Gaze correction aims to redirect the person's gaze into the camera by manipulating the eye region, and it can be considered as a specific image resynthesis problem. Gaze correction has a wide range of applications in real life, such as taking a picture with staring at the camera. In this paper, we propose a novel method that is based on the inpainting model to learn from the face image to fill in the missing eye regions with new contents representing corrected eye gaze. Moreover, our model does not require the training dataset labeled with the specific head pose and eye angle information, thus, the training data is easy to collect. To retain the identity information of the eye region in the original input, we propose a self-guided pretrained model to learn the angle-invariance feature. Experiments show our model achieves very compelling gaze-corrected results in the wild dataset which is collected from the website and will be introduced in details. Code is available at https://github.com/zhangqianhui/GazeCorrection.

연구 동기 및 목표

  • 머리 자세와 눈의 각도가 다양하게 변하는 실외 이미지에서 시선 교정을 수행하는 것.
  • 비용이 많이 들고 자세 레이블이 부여된 훈련 데이터가 필요 없는 문제를 해결하기 위해 자기지도 학습을 활용하는 것.
  • 눈의 각도 변화가 심한 상황에서도 원본 눈 부위의 신원 정보를 유지하기 위해 각도에 영향을 받지 않는 특징을 사용하는 것.
  • 자기지도 모듈을 도입하여 적대적 훈련의 안정성과 품질을 향상시키기 위한 것.
  • 다양한 머리 자세에 대해 강건하고 고해상도, 현실적인 시선 교정을 달성하기 위한 것.

제안 방법

  • 생성적 적대적 네트워크(GAN) 기반의 완전 컨volution 신경망을 사용하여 교정된 눈 부위를 합성하는 이미지 복원 모델을 적용한다.
  • 원본 눈 부위에서 각도에 영향을 받지 않는 특징을 추출하기 위해 자기지도 사전 학습 모델을 도입하며, 이는 생성자와 판별자 모두를 안내하는 데 사용된다.
  • 생성자는 각도에 영향을 받지 않는 특징에 조건을 두어 시선 교정 과정에서 신원 유지 보장을 한다.
  • 생성자와 판별자에 자기지도 학습 모듈을 추가하여 좌우 눈 예측을 위한 이진 분류 손실을 사용함으로써 훈련의 안정성과 현실감 향상을 도모한다.
  • 고해상도의 시각적 현실감 있는 복원을 위해 전역 및 국소 판별자 아키텍처를 사용한다.
  • 훈련 과정은 엔드 투 엔드이며, 짝지어진 진짜 눈의 각도나 머리 자세 레이블이 필요 없어, 실외에서의 데이터 수집이 용이하다.

실험 결과

연구 질문

  • RQ1라벨이 없는 머리 자세나 눈의 각도 데이터 없이도 실외 이미지에서 시선 교정을 효과적으로 수행할 수 있는가?
  • RQ2눈의 각도와 자세의 변화가 심한 상황에서도 원본 눈 부위의 신원 정보를 어떻게 유지할 수 있는가?
  • RQ3자기지도 학습이 시선 교정에서 적대적 훈련의 안정성과 품질에 얼마나 기여하는가?
  • RQ4제안된 자기지도 특징 추출 기법은 표준 GAN 기반 복원 기법에 비해 얼굴 신원 유지에 얼마나 효과적인가?
  • RQ5기존 최고 수준의 시선 교정 모델에 비해 제안된 방법의 현실감과 교정 정확도 측면에서 성능은 어떠한가?

주요 결과

  • GazeGAN은 NewGaze 테스트 세트에서 Inception Score(IS) 3.10 ± 0.12와 Fréchet Inception Distance(FID) 28.34를 기록하여, GLGAN(IS: 2.87 ± 0.07)과 DeepWarp보다 두 지표에서 모두 뛰어난 성능을 보였다.
  • 사용자 연구 결과, GazeGAN은 최고의 결과로 35.40%의 표를 얻었으며, StarGAN(29.60%), GLGAN(21.87%), DeepWarp(13.13%)에 비해 유의미하게 높아, 더 뛰어난 시각적 현실감을 지닌 것으로 나타났다.
  • 절단 실험 결과, 자기지도 학습 모듈이 모든 훈련 반복 동안 IS와 FID 점수를 향상시켜, 훈련의 안정성 향상과 출력 품질 향상에 효과적임을 입증했다.
  • 정성적 결과에서는 GazeGAN이 특히 극단적인 머리 자세를 가진 실외 이미지에서 DeepWarp보다 더 선명하고 현실적인 시선 교정을 생성함을 확인할 수 있었다.
  • 자기지도 사전 학습 모델은 다양한 눈의 각도에서도 신원 특징을 성공적으로 유지하였으며, 교정된 눈 부위에서 일관된 얼굴 구조와 질감이 유지됨을 통해 이를 입증하였다.
  • 다양한 머리 자세에 대해 잘 일반화됨을 보였으며, 보강 자료와 프로젝트 페이지의 결과에서 극도로 도전적인 실외 이미지에서도 일관된 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.