Skip to main content
QUICK REVIEW

[논문 리뷰] DwNet: Dense warp-based network for pose-guided human video generation

Polina Zablotskaia, Aliaksandr Siarohin|arXiv (Cornell University)|2019. 10. 21.
Human Pose and Action Recognition참고 문헌 40인용 수 9
한 줄 요약

DwNet는 밀도 있는 워프 기반 정렬과 순환적 시간 조건화를 활용한 GAN 기반의 비디오 생성 프레임워크를 제안한다. 밀도 있는 포즈 표현과 이전 출력에 조건화된 반복적 프레임 생성을 통해 패션 및 타이치 데이터셋에서 실사성, 시간적 일관성, 외관 충실도 측면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Generation of realistic high-resolution videos of human subjects is a challenging and important task in computer vision. In this paper, we focus on human motion transfer - generation of a video depicting a particular subject, observed in a single image, performing a series of motions exemplified by an auxiliary (driving) video. Our GAN-based architecture, DwNet, leverages dense intermediate pose-guided representation and refinement process to warp the required subject appearance, in the form of the texture, from a source image into a desired pose. Temporal consistency is maintained by further conditioning the decoding process within a GAN on the previously generated frame. In this way a video is generated in an iterative and recurrent fashion. We illustrate the efficacy of our approach by showing state-of-the-art quantitative and qualitative performance on two benchmark datasets: TaiChi and Fashion Modeling. The latter is collected by us and will be made publicly available to the community.

연구 동기 및 목표

  • 단일 소스 이미지와 드라이빙 동작 비디오로부터 고해상도이자 시간적으로 일관된 인간 주제의 비디오를 생성하는 데 도전한다.
  • 희소 키포인트나 뼈대 기반 방법 대비 밀도 있는 중간 표현을 사용하여 외관 보존을 향상시키고 시각적 잡음을 줄인다.
  • 이전에 생성된 프레임에 조건화된 방식으로 각 프레임 생성을 조건화하여 시간적 일관성을 향상시킨다.
  • 밀도 있는 포즈 기반 워핑에서 발생하는 오류를 수정하기 위해 개선된 워프 격자 추정 모듈을 개발한다. 이는 텍스처 정렬과 현실성 향상에 기여한다.
  • 향후 연구를 지원하기 위해 새로운 고해상도 패션 비디오 데이터셋을 수집하고 공개한다.

제안 방법

  • DensePose에서 유도된 밀도 있는 중간 표현을 활용하여 소스 주제의 외관을 목표 포즈로 정밀하게 워핑한다.
  • 두 단계의 워프 정밀화 메커니즘을 도입한다: 먼저 굵은 워프 격자 추정을 수행하고, 이후에 보정된 워프 격자를 통해 포즈 유도 왜곡을 수정한다.
  • 생성자에 소스 이미지, 목표 포즈 및 이전에 생성된 프레임을 조건으로 하는 GAN 기반 오토에코딩 아키텍처를 활용한다.
  • 이전 프레임에 조건화된 마르코프 모델링 전략을 적용하여 비디오 시퀀스 전반에 걸쳐 시간적 일관성을 확보한다.
  • 실사성과 정렬도를 최적화하기 위해 인지 손실, FID, 평균 키포인트 거리(AKD)를 평가 지표로 사용한다.
  • 모델을 엔드 투 엔드로 훈련시키며, 생성자 손실과 인지 재구성 손실을 활용해 고주파 세부 정보와 텍스처 충실도를 유지한다.

실험 결과

연구 질문

  • RQ1희소 키포인트나 뼈대 기반 방법에 비해 밀도 있는 워프 기반 접근 방식이 포즈 기반 인간 비디오 생성의 시각적 품질 향상과 잡음 감소에 기여하는가?
  • RQ2이전 프레임에 조건화된 프레임 생성 방식이 비디오 합성에서 시간적 일관성 향상에 뚜렷한 기여를 하는가?
  • RQ3개선된 워프 격자 추정 모듈이 워핑 오류를 어느 정도 감소시키고 외관 일관성을 향상시키는가?
  • RQ4제안된 방법이 고해상도 인간 운동 전이 작업에서 최신 기술 수준의 접근 방식과 정량적·정성적으로 비교해 볼 때 어떻게 성능을 내는가?
  • RQ5공개 가능한 고해상도 패션 비디오 데이터셋이 이 분야의 벤치마킹 및 재현 가능성 향상에 도움이 되는가?

주요 결과

  • 패션 데이터셋에서 DwNet는 인지 손실(0.2811)과 FID(13.09)를 모두 최저 기록하여 MonkeyNet과 좌표 보정 방법을 압도한다.
  • 타이치 데이터셋에서 DwNet는 인지 손실 0.5960과 FID 75.44를 기록하여 복잡한 운동 시퀀스에서 뛰어난 성능을 보였다.
  • 사용자 선호도 연구 결과, 패션 데이터셋에서 99.6%의 비교에서 DwNet가 선호되었고, 타이치 데이터셋에서는 85.2%의 선호도를 기록하여 강력한 시각적 품질을 입증했다.
  • 절단 실험 결과, 개선된 워프 격자 모듈을 제거할 경우 FID가 13.09에서 15.37로 상승하며, 워프 구성 요소를 모두 제거할 경우 뿌연, 일관성 없는 출력이 발생함을 확인했다.
  • 이전 프레임에 조건화된 마르코프 조건화 방식이 시각적 및 정량적 결과를 통해 시간적 일관성 향상에 뚜렷한 기여를 했다.
  • 거친 워프 격자와 개선된 워프 격자를 모두 포함한 전체 모델이 가장 현실적이고 일관성 있는 결과를 생성했으며, 텍스처 이질화와 얼굴 왜곡이 최소화되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.