Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Rendering and Reenactment of Human Actor Videos

Lingjie Liu, Weipeng Xu|arXiv (Cornell University)|2018. 09. 11.
Advanced Vision and Imaging참고 문헌 72인용 수 10
한 줄 요약

이 논문은 고해상도 3D 스캔이 아닌 단일 카메라 영상과 중간 품질의 3D 템플릿 모델만을 사용하여 인간 배우의 영상 수준의 재현을 위한 학습 기반 방법을 제안한다. 운동 캡처된 자세 시퀀스를 사용하여 3D 모델의 합성 렌더링을 포토 realism 이미지로 변환하도록 조건부 GAN을 훈련시킴으로써, 정체성 유지 영상 합성에서 최신 기술 수준의 성능을 달성하며, 프레임당 68ms의 실시간 추론이 가능하다.

ABSTRACT

We propose a method for generating video-realistic animations of real humans under user control. In contrast to conventional human character rendering, we do not require the availability of a production-quality photo-realistic 3D model of the human, but instead rely on a video sequence in conjunction with a (medium-quality) controllable 3D template model of the person. With that, our approach significantly reduces production cost compared to conventional rendering approaches based on production-quality 3D models, and can also be used to realistically edit existing videos. Technically, this is achieved by training a neural network that translates simple synthetic images of a human character into realistic imagery. For training our networks, we first track the 3D motion of the person in the video using the template model, and subsequently generate a synthetically rendered version of the video. These images are then used to train a conditional generative adversarial network that translates synthetic images of the 3D model into realistic imagery of the human. We evaluate our method for the reenactment of another person that is tracked in order to obtain the motion data, and show video results generated from artist-designed skeleton motion. Our results outperform the state-of-the-art in learning-based human image synthesis. Project page: http://gvv.mpi-inf.mpg.de/projects/wxu/HumanReenactment/

연구 동기 및 목표

  • 고품질 3D 모델이 필요 없이 사용자 제어 하에 실제 인간의 영상 수준의 애니메이션을 가능하게 하기 위해.
  • 기존의 포토 realism 3D 렌더링 파이프라인에 비해 제작 비용과 복잡성을 줄이기 위해.
  • 기존 영상의 편집을 통해 한 배우의 동작을 다른 배우로 이식함으로써 현실적인 편집을 가능하게 하기 위해.
  • 딥 러닝을 활용하여 합성 3D 렌더링과 실제 영상의 외관 간 격차를 메우기 위해.
  • 고해상도 출력 생성과 함께 상호작용이 가능하고 실시간 자세 편집을 지원하기 위해.

제안 방법

  • 단일 카메라 정적 자세 영상에서 텍스처가 적용된 3D 표면 모델과 뼈대가 있는 스킴을 재구성하기 위해.
  • 수정된 단일 카메라 인간 성능 캡처 방법을 사용하여 운동 영상에서 배우의 3D 운동을 추적하기 위해.
  • 추적된 자세를 사용하여 3D 모델에서 색상 이미지, 깊이 맵, 세분화를 렌더링하여 훈련 데이터를 합성하기 위해.
  • 조건부 생성 적대 기반 네트워크(cGAN)를 훈련시켜 합성 렌더링을 대상 인물의 포토 realism 이미지로 변환하기 위해.
  • 복잡한 자세에서의 특징 정렬 및 외관 전달 향상을 위해 cGAN에 주의 메커니즘을 통합하기 위해.
  • 추론 과정에서 사용자가 정의한 동작(예: MoCap, 영상, 스켈레톤)으로 3D 모델을 애니메이션하고, 조건 입력을 렌더링한 후 훈련된 네트워크를 통해 현실적인 영상을 생성하기 위해.

실험 결과

연구 질문

  • RQ1신경망은 고성능 3D 모델 없이 저품질 3D 렌더링을 포토 realism 인간 영상으로 번역할 수 있는가?
  • RQ2원본 영상의 동작을 정체성과 외관을 유지하면서 다른 배우로 정확히 전달할 수 있는가?
  • RQ3학습된 이미지 번역 프레임워크를 사용하여 실시간 상호작용 영상 편집을 달성할 수 있는가?
  • RQ4극단적인 자세, 가림, 추적 오류 등의 상황에서 이 방법의 한계는 무엇인가?
  • RQ5단일 기준 이미지만으로도 일반화가 가능한가, 아니면 특정 개인에 한정된 훈련에 의존하는가?

주요 결과

  • 이 방법은 이미지 기반 인간 영상 합성에서 최신 기술 수준의 성능을 달성하며, 이전의 학습 기반 접근법을 능가한다.
  • 네트워크 추론 시간은 프레임당 단지 68ms이며, 실시간 상호작용 자세 편집이 가능하다.
  • 512×512 픽셀의 고해상도 결과를 얻을 수 있으며, 더 긴 훈련 시간을 감수함으로써 선명도를 향상시킬 수 있다.
  • 손과 발 부위에서 큰 자세 변화, 추적 오류, 희귀하거나 가려진 자세로 인해 아티팩트가 발생하는 실패 케이스가 존재한다.
  • 시간적 번짐과 국소적인 고주파 아티팩트가 지속되며, 이는 현재 GAN 아키텍처가 영상 합성에 한계를 가짐을 시사한다.
  • 프레임 연결을 통한 시간적 맥락 통합은 성능 향상에 크게 기여하지 않아, 더 정교한 시간 모델링이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.