Skip to main content
QUICK REVIEW

[논문 리뷰] DeepWarp: Photorealistic Image Resynthesis for Gaze Manipulation

Yaroslav Ganin, Daniil Kononenko|arXiv (Cornell University)|2016. 07. 25.
Face recognition and analysis참고 문헌 23인용 수 10
한 줄 요약

이 논문은 깊이 있는 순방향 신경망인 DeepWarp를 제안하며, 학습된 밝기 보정을 통한 군집에서 세밀한 공간 왜곡을 사용하여 이미지 내에서 사진처럼 현실적인 시선 조작을 구현한다. 모델은 끝에서 끝까지 왜곡 필드와 조명 조정을 동시에 학습하여 최신 기술 수준의 현실감과 세부 사항 보존을 달성하며, 소비자용 GPU에서 최대 20 fps로 고해상도 시선 재지정을 구현한다.

ABSTRACT

In this work, we consider the task of generating highly-realistic images of a given face with a redirected gaze. We treat this problem as a specific instance of conditional image generation and suggest a new deep architecture that can handle this task very well as revealed by numerical comparison with prior art and a user study. Our deep architecture performs coarse-to-fine warping with an additional intensity correction of individual pixels. All these operations are performed in a feed-forward manner, and the parameters associated with different operations are learned jointly in the end-to-end fashion. After learning, the resulting neural network can synthesize images with manipulated gaze, while the redirection angle can be selected arbitrarily from a certain range and provided as an input to the network.

연구 동기 및 목표

  • 고감도의 시각적 품질을 갖춘 얼굴 이미지에서 사진처럼 현실적인 시선 재지정을 위한 딥러닝 기법을 개발하기 위해.
  • 특징 압축을 피하여 오토에코더 기반 방법의 한계, 즉 흐림과 평균 회귀 효과를 해결하기 위해.
  • 지정된 범위 내에서 연속적이고 임의의 시선 재지정 각도를 입력으로 허용하기 위해.
  • 이전의 딥러닝 및 비딥러닝 방법보다 현실감과 세부 사항 보존을 향상시키기 위해.
  • 비디오 회의 및 후반 제작과 같은 애플리케이션에 적합한 실시간 또는 근접 실시간 성능를 달성하기 위해.

제안 방법

  • 모델은 시선 재지정을 위한 공간 왜곡 필드를 예측하기 위해 완전 컨volution형, 군집에서 세밀한 아키텍처를 사용한다.
  • 왜곡 과정을 안내하기 위해 시선 재지정 각도와 얼굴 키포인트 맵을 보조 입력으로 통합한다.
  • 학습된 밝기 보정 모듈이 픽셀 밝기와 대비를 조정하여 반사광과 질감 세부 정보를 유지한다.
  • 출력과 지상 진실 이미지 간의 픽셀 단위 L2 또는 L1 거리에 기반한 지도 학습 손실을 사용하여 네트워크를 끝에서 끝까지 훈련시킨다.
  • 작은 오차 정렬 문제에 대응하기 위해 6x6 크롭 창 내에서 공간 검색을 허용하는 수정된 손실 함수를 도입한다.
  • 버티컬 블로킹 압축을 피하여 현실감을 위해 필수적인 고주파 세부 정보를 유지한다.

실험 결과

연구 질문

  • RQ1특징를 압축하지 않고도 깊이 있는 순방향 네트워크가 사진처럼 현실적인 시선 조작을 달성할 수 있는가?
  • RQ2왜곡과 밝기 보정을 끝에서 끝까지 학습하는 방식이 오토에코더 기반 또는 랜덤 포레스트 기반 방법에 비해 현실감과 세부 사항 보존에서 어떻게 비교되는가?
  • RQ3모델이 연속적인 범위 내에서 임의의 시선 재지정 각도로 일반화할 수 있는 정도는 어느 정도인가?
  • RQ4헤드 포즈 변화나 안경과 같은 가림 요소가 있을 경우 모델의 성능은 어떻게 되는가?
  • RQ5간단하고 컴act한 신경망이 품질과 효율성 측면에서 더 큰, 더 복잡한 모델인 랜덤 포레스트보다 뛰어날 수 있는가?

주요 결과

  • 제안된 방법은 시선 방향 추정에 대해 평균 사용자 추측 정확도가 26.4초(40초 중)를 기록하여 기준 방법보다 뚜렷이 뛰어나다.
  • 사용자 연구 결과, 8.1%의 추측이 1초 이내로 정확하여 강력한 시각적 현실감을 입증한다.
  • 모델은 반사광과 질감 세부 정보와 같은 세부 사항을 유지하며, 정량적 결과로 이전 방법보다 낮은 MSE와 높은 시각적 품질을 보였다.
  • 중급 GPU(NVIDIA GeForce 750M)에서 최대 20 fps로 실행되어 실시간 성능를 입증했다.
  • 모델은 랜덤 포레스트 기준보다 더 작다(250 KB), 동시에 뛰어난 현실감과 일반화 능력을 유지한다.
  • 손실 함수 내에서 공간 검색(확장된 크롭 창을 통한)을 사용함으로써 훈련 데이터의 경미한 정렬 오차에 대한 강건성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.