Skip to main content
QUICK REVIEW

[논문 리뷰] Vid2Game: Controllable Characters Extracted from Real-World Videos

Oran Gafni, Lior Wolf|arXiv (Cornell University)|2019. 04. 17.
Human Pose and Action Recognition참고 문헌 38인용 수 10
한 줄 요약

이 논문은 실생활 영상에서 제어 가능한, 사진처럼 사실적인 캐릭터를 추출하고 2차원 제어 신호(예: 조작기 입력)를 사용해 재생하는 Vid2Game를 제안한다. 두 가지 새로운 딥 네트워크—자기연쇄적 자세 생성을 위한 Pose2Pose와 임의의 배경 교체 기능을 갖춘 고해상도 이미지 합성 기능을 갖춘 Pose2Frame—를 사용하여 정확한 운동과 외관 모델링을 바탕으로 현실적이며 잡음 없는 비디오 시퀀스를 구현한다.

ABSTRACT

We are given a video of a person performing a certain activity, from which we extract a controllable model. The model generates novel image sequences of that person, according to arbitrary user-defined control signals, typically marking the displacement of the moving body. The generated video can have an arbitrary background, and effectively capture both the dynamics and appearance of the person. The method is based on two networks. The first network maps a current pose, and a single-instance control signal to the next pose. The second network maps the current pose, the new pose, and a given background, to an output frame. Both networks include multiple novelties that enable high-quality performance. This is demonstrated on multiple characters extracted from various videos of dancers and athletes.

연구 동기 및 목표

  • 비제어적인 실생활 영상에서 제어 가능한 사진 수준의 인간 캐릭터를 추출하여 동적인 가상 환경에서 활용할 수 있도록 하는 것.
  • 사용자가 정의한 2차원 제어 신호(예: 조작기 경로)에 따라 추출된 캐릭터가 움직이는 장시간의 일관성 있는 비디오 시퀀스를 생성하는 것.
  • 기존 배경을 사용자 지정한 배경(동적인 것 포함)으로 무작위로 교체하면서도 현실적인 혼합과 그림자 효과를 유지하는 것.
  • 배경 분離, 훈련 분포 외의 자세 일반화, 자기연쇄적 생성에서의 시간적 드리프트와 같은 과제를 해결하는 것.

제안 방법

  • 2차원 제어 신호(예: 질량 중심 경로)와 현재 자세를 조건으로 하여 자기연쇄적으로 전신 자세 시퀀스를 생성하는 Pose2Pose(P2P) 네트워크를 사용한다.
  • 생성된 자세, 배경 이미지, 전경 마스크로부터 고해상도의 사진 수준의 비디오 프레임을 합성하는 Pose2Frame(P2F) 네트워크를 활용한다.
  • 두 네트워크의 기반으로 pix2pixHD 프레임워크를 채택하지만, 새로운 구성 요소를 추가하여 성능을 향상시킨다: 개선된 자세 제어를 위한 조건부 블록, 손에 들고 있는 물체를 위한 오브제 채널 통합, 특징 매칭 기반의 판별자 손실.
  • 일致적인 2차원 신체 자세 표현과 의미 세그멘테이션을 위해 DensePose를 활용하여 손에 들고 있는 물체를 추출함으로써 정확한 외관 모델링을 가능하게 한다.
  • 예측 안정성 향상과 시간적 드리프트 감소를 위해 추론 중에 '선생 강제' 기법을 적용한다.
  • 예측된 마스크와 그림자 블렌딩을 활용하여 잡음 없는 조작을 가능하게 하는 배경 교체 파이프라인을 도입한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 비제어 영상에서 제어 가능한 사진 수준의 캐릭터를 추출하고, 저차원 2차원 제어 신호만으로 재생할 수 있는가?
  • RQ2모델이 배경 교체가 가능한 현실적인 비디오 시퀀스를 생성하면서도 운동 역학과 외관 충실도를 유지할 수 있는가?
  • RQ3모델이 훈련 분포 외의 새로운 자세와 제어 신호에 얼마나 잘 일반화되는가?
  • RQ4이전의 비디오 투 비디오 번역 모델에 비해 이미지 품질, 배경 처리 능력, 시간적 일관성 측면에서 제안된 방법은 어떤가?

주요 결과

  • Pose2Frame 네트워크는 pix2pixHD 및 vid2vid와 같은 기준 모델 대비 뛰어난 시각적 품질을 달성하였으며, LPIPS 점수는 낮고(SR: 0.28 vs. 0.35, 테니스 테스트 세트 기준), SSIM 값은 높았다.
  • P2F 네트워크는 복잡한 환경에서 동적인 배경이 있는 경우에도 배경 잡음과 캐릭터 왜곡을 크게 줄여주었으며, 전체 환경을 모델링하는 기존 방법보다 뛰어난 성능을 보였다.
  • 제거 분석 결과, 제안된 조건부 블록과 오브제 채널 통합이 자세 생성 품질을 향상시켜 기존 기준 대비 LPIPS 점수를 12% 감소시켰다.
  • vid2vid 기준 대비 캐릭터 비율이 일관되며 주행 자세에 따라 왜곡이 발생하지 않아, 반면 기존 기준은 눈에 띄는 확대 및 왜곡을 보였다.
  • 시간적 부드러움 손실을 사용하지 않았음에도 불구하고, 최신 기술 수준의 방법과 유사한 수준의 시간적 부드러움을 유지함으로써 내부 운동 모델링의 뛰어난 강건성을 입증했다.
  • 시스템은 매우 동적인 또는 복잡한 배경에 캐릭터를 배치하더라도 장시간의 일관성 있는 비디오 시퀀스를 생성하며, 그림자 및 운동 효과의 현실적인 혼합을 성공적으로 구현했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.