[논문 리뷰] Pose Guided Human Video Generation
이 논문은 인간 동작 및 표정 데이터셋에서 비디오의 현실성과 운동 제어 성능을 햖थे하여 최신 기술 수준에 도달한, 분리된 인간 비디오 생성을 위한 이단계적 포즈 가이드 프레임워크를 제안한다. 먼저 동작 레이블에 조건화된 실감나는 포즈 시퀀스를 예측하기 위해 포즈 시퀀스 GAN(PSGAN)을 사용하고, 그 다음에 예측된 포즈에서 사진 수준의 비디오 프레임을 생성하는 정신 일관성 GAN(SCGAN)을 적용하여 노이즈에 대한 저항성을 높이기 위해 생성된 포즈와 진짜 포즈 간의 고수준 의미 일관성을 강제한다. 이 방법은 인간 동작 및 표정 데이터셋에서 비디오의 현실성과 운동 제어 성능에서 최신 기술 수준을 달성한다.
Due to the emergence of Generative Adversarial Networks, video synthesis has witnessed exceptional breakthroughs. However, existing methods lack a proper representation to explicitly control the dynamics in videos. Human pose, on the other hand, can represent motion patterns intrinsically and interpretably, and impose the geometric constraints regardless of appearance. In this paper, we propose a pose guided method to synthesize human videos in a disentangled way: plausible motion prediction and coherent appearance generation. In the first stage, a Pose Sequence Generative Adversarial Network (PSGAN) learns in an adversarial manner to yield pose sequences conditioned on the class label. In the second stage, a Semantic Consistent Generative Adversarial Network (SCGAN) generates video frames from the poses while preserving coherent appearances in the input image. By enforcing semantic consistency between the generated and ground-truth poses at a high feature level, our SCGAN is robust to noisy or abnormal poses. Extensive experiments on both human action and human face datasets manifest the superiority of the proposed method over other state-of-the-arts.
연구 동기 및 목표
- 기존 비디오 생성 방법에서 인간 운동에 대한 명시적 운동 제어의 부족을 해결하기 위해.
- 인간 운동 역학을 외형과 분리하여 제어성과 현실성 향상을 위해.
- 노이즈 또는 비정상적인 포즈 입력에 대해서도 안정성을 유지하는 강력한 비디오 생성 프레임워크를 개발하기 위해.
- 생성된 비디오에서 인간 포즈와 외형을 명시적으로 조작할 수 있도록 하기 위해.
- 단일 입력 이미지와 포즈 시퀀스만을 사용하여 고해상도 비디오 합성을 달성하기 위해.
제안 방법
- 행동 클래스 레이블에 조건화된 시간적으로 일관된 포즈 시퀀스를 생성하기 위해 포즈 시퀀스 생성 적대적 네트워크(PSGAN)를 훈련한다.
- 예측된 포즈 시퀀스와 입력 이미지에서 비디오 프레임을 생성하는 정신 일관성 생성 적대적 네트워크(SCGAN)를 사용하며, 생성된 포즈와 진짜 포즈 간의 고수준 특징 표현에서 의미 일관성을 강제하는 손실을 적용한다.
- SCGAN은 훈련을 안정화하고 추론 중에 노이즈 또는 비정상적인 포즈에 대한 강건성을 향상시키기 위해 특징 수준의 일관성 손실을 사용한다.
- 이 프레임워크는 운동(포즈 시퀀스)과 외형(이미지) 생성을 분리하여 포즈와 신원에 대해 독립적인 제어를 가능하게 한다.
- 추론 중에는 오직 생성된 포즈 시퀀스만 사용되며, 의미 일관성 손실은 진짜 포즈를 사용하여 훈련 중에 적용된다.
- 이 방법은 인간 동작 및 얼굴 표정 데이터셋 모두에서 훈련 및 평가되었으며, Inception Score, SSIM, LPIPS 및 사용자 연구와 같은 정량적 지표를 포함한다.
실험 결과
연구 질문
- RQ1포즈 역학과 외형 모델링을 분리하는 분리된 비디오 생성 프레임워크가 현실성과 제어성 향상에 더 효과적인가?
- RQ2생성된 포즈와 진짜 포즈 간의 의미 일관성이 노이즈 또는 비정상적인 포즈 시퀀스에 대한 저항성 향상에 얼마나 효과적인가?
- RQ3입력 포즈가 완벽하지 않은 경우에도 명시적 포즈 및 외형 제어가 가능한 고해상도 비디오를 생성할 수 있는가?
- RQ4시각적 품질과 정량적 지표 측면에서 최신 기술 수준의 접근 방식과 비교해 볼 때 제안된 방법의 성능는 어떠한가?
- RQ5다양한 신원과 동작 유형 간에 시간적 일관성을 유지하면서 모델의 일반화 능력은 어느 정도인가?
주요 결과
- 제안된 방법은 인간 동작 데이터셋에서 Inception Score(IS)가 8.92로 이전 방법을 능가하였고, 얼굴 표정 데이터셋에서는 9.15를 기록하였다.
- 의미 일관성 손실을 적용한 SCGAN 모델은 인간 동작 데이터셋에서 구조적 유사도(SSIM) 0.87과 LPIPS 0.041을 달성하여, SCGAN-gen 기준선(비교: SSIM 0.73, LPIPS 0.083)을 능가하였다.
- 사용자 연구 결과, MoCoGAN 대비 72%, VGAN 대비 78%의 경우 제안된 방법이 더 현실적으로 평가되었다.
- 제어된 생성 실험 결과, 동일한 사람에게 다른 동작을, 그리고 다른 신원 간에 동일한 동작을 성공적으로 합성하여 분리성과 일반화 능력을 입증하였다.
- 단절 실험 결과, 의미 일관성 손실이 특히 얼굴 및 신체 영역의 세부 사항에서 노이즈를 감소시켜 비디오 품질을 크게 향상시킨다는 것이 확인되었다.
- 모든 지표에서 정적 기준선(첫 번째 프레임 반복)을 초월하여 효과적인 운동 생성 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.