Skip to main content
QUICK REVIEW

[논문 리뷰] Generating 3D People in Scenes without People

Yan Zhang, Mohamed S. Hassan|arXiv (Cornell University)|2019. 12. 05.
Human Pose and Action Recognition참고 문헌 56인용 수 4
한 줄 요약

이 논문은 사람 없는 3D 환경에서 의미적으로도, 물리적으로도 타당한 3D 인간 신체를 자동으로 합성하는 이단계 생성 프레임워크를 제안한다. 이는 환경의 깊이와 의미 정보에 조건부된 조건부 변동형 자동인코더(CVAE)를 사용하여 다양한 형태 인식 인간 메쉬를 생성하고, 그 후 기하학적 인식 피팅을 통해 물리적 타당성을 강제함으로써 기존 방법들보다 실현성, 다양성, 상호작용 충실도 면에서 뛰어나다.

ABSTRACT

We present a fully automatic system that takes a 3D scene and generates plausible 3D human bodies that are posed naturally in that 3D scene. Given a 3D scene without people, humans can easily imagine how people could interact with the scene and the objects in it. However, this is a challenging task for a computer as solving it requires that (1) the generated human bodies to be semantically plausible within the 3D environment (e.g. people sitting on the sofa or cooking near the stove), and (2) the generated human-scene interaction to be physically feasible such that the human body and scene do not interpenetrate while, at the same time, body-scene contact supports physical interactions. To that end, we make use of the surface-based 3D human model SMPL-X. We first train a conditional variational autoencoder to predict semantically plausible 3D human poses conditioned on latent scene representations, then we further refine the generated 3D bodies using scene constraints to enforce feasible physical interaction. We show that our approach is able to synthesize realistic and expressive 3D human bodies that naturally interact with 3D environment. We perform extensive experiments demonstrating that our generative framework compares favorably with existing methods, both qualitatively and quantitatively. We believe that our scene-conditioned 3D human generation pipeline will be useful for numerous applications; e.g. to generate training data for human pose estimation, in video games and in VR/AR. Our project page for data and code can be seen at: \url{https://vlg.inf.ethz.ch/projects/PSI/}.

연구 동기 및 목표

  • VR/AR, 로봇공학, 합성 데이터 생성 등 다양한 분야에서 사람 없는 3D 환경에서의 현실적인 자동 생성 3D 인간 신체의 부족 문제를 해결하기 위해.
  • 사람이 환경 물체(예: 소파에 앉는 것, 스토브 근처에 서 있는 것 등)와 의미적으로 타당한 상호작용을 할 수 있도록 위치가 의미 있게 배치된 인간-환경 상호작용을 모델링하기 위해.
  • 신체 간 상호갈등과 표면 접촉을 방지함으로써 신체 간 침투를 방지하고 자연스러운 자세를 유지함으로써 물리적으로 타당한 상호작용을 보장하기 위해.
  • 단일 RGB 영상에서의 3D 인간 자세 추정 등의 후속 작업을 위한 사전 지식으로 사용할 수 있는 환경 조건부 3D 인간 생성 파이프라인을 개발하기 위해.
  • 신규 데이터셋과 평가 지표를 통해 환경 인식 3D 인간 메쉬 생성을 위한 벤치마크를 수립하기 위해.

제안 방법

  • 환경의 깊이와 의미 정보의 잠재 표현에 조건부된 조건부 변동형 자동인코더(CVAE)를 학습하여 3D 인간 신체 메쉬를 생성한다.
  • SMPL-X 모델을 기반 신체 표현으로 사용하여 형태와 자세 파rameter를 포함한 세밀하고 미분 가능한 3D 메쉬 출력을 가능하게 한다.
  • 생성 후 기하학적 인식 피팅을 적용하여 자세를 보정함으로써 상호갈등을 최소화하고 환경 표면과의 접촉을 보장한다.
  • 충돌과 떨어진 상태를 방지하기 위해 손실 항목 $\mathcal{L}_f$ 를 도입하여 물리적 타당성을 강제한다.
  • 랜더링을 통해 다수의 가상 시점에서 생성된 합성 데이터를 포함한 확장된 PROX-Qualitative 데이터셋을 기반으로 프레임워크를 학습한다.
  • 사용자 연구와 정량적 벤치마크를 통해 세 가지 평가 지표(의미 타당성, 물리적 타당성, 다양성)를 사용하여 평가한다.

실험 결과

연구 질문

  • RQ1학습된 생성 모델은 인간의 수동 조작 없이도 의미적으로 타당한 3D 인간 자세를 다양한 형태로 생성할 수 있는가?
  • RQ2기하학적 인식 피팅은 상호갈등이나 떨어진 상태와 같은 물리적으로 타당하지 않은 구성 요소를 얼마나 효과적으로 수정할 수 있는가?
  • RQ3환경 조건부 사전 지식은 단일 RGB 영상에서의 3D 인간 자세 추정 성능을 얼마나 향상시키는가?
  • RQ4제안된 방법은 3D 인간 메쉬 생성 분야에서 최신 기준 기준에 비해 정량적·정성적으로 어떻게 비교되는가?
  • RQ5이 방법은 다양한 실내 환경에서 일반화되어 현실적인 인간-신체 상호작용을 생성할 수 있는가?

주요 결과

  • 제안된 방법은 기준 모델 대비 25% 향상된 다양성 점수(표 2 참조)를 기록하며, 의미 타당성은 유사한 수준을 유지하면서 더 높은 다양성을 보여주었다.
  • 사용자 연구 결과, PROX-E에서 평균 3.49/5.0, MP3D-R에서 3.30/5.0의 평점을 기록하여 기준 모델을 초월했으며, 물리적 손실 항목을 추가한 경우 더 높은 점수를 기록했다.
  • PROX-Quantitative 데이터셋에서 3D 인간 자세 추정 성능을 향상시켜 평균 관절 오차(PJE)를 174.10 mm로 감소시키고, 정점 간 거리 오차(V2V)를 171.75 mm로 줄였으며, Simplify-X를 초월하고 PROX와 동등한 성능을 기록했다.
  • 기하학적 인식 피팅 단계는 상호갈등을 감소시키고 물리적 타당성을 향상시켜, 정성적 결과에서 낮은 충돌 페널티와 향상된 접촉 일관성을 입증했다.
  • 모델에서 유도된 환경 조건부 사전 지식은 환경 인식 초기화를 제공함으로써 3D 자세 추정 성능을 향상시켰으며, 표준 기준 모델 대비 V2V 오차에서 최대 1.5% 향상된 결과를 기록했다.
  • 종합적인 정량적·정성적 평가를 통해 제안된 방법은 현실적이고 다양한, 물리적으로 타당한 3D 환경 내 인간 신체 생성에서 최신 기술 수준의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.