Skip to main content
QUICK REVIEW

[논문 리뷰] Human Mesh Recovery from Multiple Shots

Georgios Pavlakos, Jitendra Malik|arXiv (Cornell University)|2020. 12. 17.
Human Pose and Action Recognition참고 문헌 50인용 수 11
한 줄 요약

이 논문은 영화와 같은 편집 영상에서 발생하는 시간적 불연속성(예: 영화의 샷 전환)을 다중시점 신호로 활용하여, 샷 경계를 넘어서도 일관된 3D 인간 메시 시퀀스를 복원하는 다중샷 최적화 프레임워크를 제안한다. 영화에서 가짜 지도 데이터를 생성함으로써 단일 이미지 기반 메시 복원의 강건성을 향상시키고, 손실 프레임이 발생하는 샷 전환 상황에서도 안정적이고 효과적인 트랜스포머 기반 시간적 모델을 가능하게 한다.

ABSTRACT

Videos from edited media like movies are a useful, yet under-explored source of information. The rich variety of appearance and interactions between humans depicted over a large temporal context in these films could be a valuable source of data. However, the richness of data comes at the expense of fundamental challenges such as abrupt shot changes and close up shots of actors with heavy truncation, which limits the applicability of existing human 3D understanding methods. In this paper, we address these limitations with an insight that while shot changes of the same scene incur a discontinuity between frames, the 3D structure of the scene still changes smoothly. This allows us to handle frames before and after the shot change as multi-view signal that provide strong cues to recover the 3D state of the actors. We propose a multi-shot optimization framework, which leads to improved 3D reconstruction and mining of long sequences with pseudo ground truth 3D human mesh. We show that the resulting data is beneficial in the training of various human mesh recovery models: for single image, we achieve improved robustness; for video we propose a pure transformer-based temporal encoder, which can naturally handle missing observations due to shot changes in the input frames. We demonstrate the importance of the insight and proposed models through extensive experiments. The tools we develop open the door to processing and analyzing in 3D content from a large library of edited media, which could be helpful for many downstream applications. Project page: https://geopavlakos.github.io/multishot

연구 동기 및 목표

  • 편집된 미디어(예: 영화)에서 샷 전환이 발생하는 프레임 수준의 불연속성으로 인해 발생하는 3D 인간 메시 복원 과제를 해결한다.
  • 기존 방법들이 샷 경계를 독립적인 클립으로 간주하여 시간적 연속성을 상실하는 한계를 극복한다.
  • 다양한 샷 간의 다중시점 정보를 활용하여 잘린 부분과 가림 현상이 있는 상황에서도 3D 재구성 정확도를 향상시킨다.
  • 영화에서 대규모 가짜 지도 3D 인간 메시 데이터셋(MS-AVA)을 생성하여 강건한 메시 복원 모델 훈련을 가능하게 한다.
  • 손실 프레임이 발생하는 샷 전환 상황을 자연스럽게 처리할 수 있는 순수 트랜스포머 기반 시간적 인코더를 개발하여 영상 데이터에 대한 일반화 능력을 향상시킨다.

제안 방법

  • 동일한 장면의 연속된 샷을 다중시점 관측으로 간주하여 샷 경계를 넘어서도 3D 인간 메시를 공동 최적화한다.
  • 샷 전환 시 3D 신체 형태와 자세의 시간적 부드러움과 기하학적 일관성을 강제하는 다중샷 최적화 절차를 제안한다.
  • 영화에서 복원된 3D 시퀀스를 가짜 지도 데이터로 활용하여 단일 이미지 기반 메시 복원 모델(HMR 등)을 사전 훈련한다.
  • 장거리 시간적 맥락을 고려하고 손실된 프레임을 명시적으로 무시할 수 있는 순수 트랜스포머 기반 시간적 인코더(t-HMMR)를 설계한다.
  • 청결한 시퀀스와 샷 전환으로 인한 손실 프레임이 포함된 시퀀스를 모두 활용하여 훈련함으로써 강건성을 향상시킨다.
  • AVA 데이터셋에 이 프레임워크를 적용하여 35만 개 이상의 3D 메시 프레임을 생성하였으며, 이를 MS-AVA로 명명하여 후속 훈련 및 평가에 활용한다.

실험 결과

연구 질문

  • RQ1편집 영상에서 발생하는 샷 전환이, 프레임 수준의 불연속성에도 불구하고 다중시점 신호로 활용될 수 있는가?
  • RQ2단일 샷 또는 독립적인 샷 처리 방식에 비해 다중샷 최적화가 더 정확하고 일관성 있는 3D 인간 메시 시퀀스를 제공하는가?
  • RQ3생성된 가짜 지도 3D 데이터(MS-AVA)가 심한 잘림 상황에서 단일 이미지 기반 메시 복원 모델의 강건성을 향상시키는가?
  • RQ4순수 트랜스포머 기반 시간적 인코더가 컨볼루션 또는 순환 인코더보다 샷 전환으로 인한 손실 프레임을 더 효과적으로 처리하는가?
  • RQ5훈련 시 손실 프레임이 포함된 불완전한 시퀀스를 포함시킴으로써 실세계 영상 데이터의 샷 경계에서 일반화 능력이 크게 향상되는가?

주요 결과

  • 제안된 다중샷 최적화 기법은 특히 심한 잘림과 가림 상황에서 3D 메시 재구성 품질을 크게 향상시킨다.
  • MS-AVA 데이터로 HMR를 훈련시킴으로써 3DPW에서 PA-MPJPE가 59.2mm에서 57.8mm로 감소하여 도전적인 입력에 대한 강건성이 향상됨을 입증한다.
  • 트랜스포머 기반 시간적 모델(t-HMMR)은 더 적은 훈련 데이터를 사용함에도 불구하고 3DPW에서 PA-MPJPE 56.1mm를 기록하여 최신 기술 수준에 도달하거나 초월한다.
  • 트랜스포머 인코더는 컨볼루션 및 순환 인코더가 자주 발산하는 것과 달리 훈련 안정성이 뛰어나고 항상 고성능 모델로 수렴한다.
  • 손실 프레임이 포함된 AVA에서, 모든 시퀀스로 훈련한 트랜스포머 모델은 크로스샷 PCK 73.8을 기록하여 컨볼루션(67.5) 및 순환(68.5) 인코더를 능가한다.
  • 정성적 결과에서는 t-HMMR이 입력 프레임이 샷 간에 끊어져도 단일 프레임 HMR보다 더 시간적으로 일관된 자세를 생성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.