Skip to main content
QUICK REVIEW

[논문 리뷰] Capturing and Inferring Dense Full-Body Human-Scene Contact

Chun-Hao P. Huang, Hongwei Yi|arXiv (Cornell University)|2022. 06. 20.
Human Pose and Action Recognition인용 수 6
한 줄 요약

이 논문은 고해상도 4K 다중 시점 영상에서 고정밀 3D 환경 및 신체 스캔을 이용해 밀도 높고 정점 수준의 인간-환경 접촉을 캡처하는 새로운 데이터셋 RICH를 소개한다. 또한, 국소적 이미지 관계를 모델링하여 가림을 극복하고 단일 RGB 이미지에서 3D 전신 접촉을 추론하는 트랜스포머 기반 네트워크인 BSTRO를 제안하며, 접촉 예측에서 70.8%의 F1 스코어를 기록하여 최신 기술 수준을 달성한다.

ABSTRACT

Inferring human-scene contact (HSC) is the first step toward understanding how humans interact with their surroundings. While detecting 2D human-object interaction (HOI) and reconstructing 3D human pose and shape (HPS) have enjoyed significant progress, reasoning about 3D human-scene contact from a single image is still challenging. Existing HSC detection methods consider only a few types of predefined contact, often reduce body and scene to a small number of primitives, and even overlook image evidence. To predict human-scene contact from a single image, we address the limitations above from both data and algorithmic perspectives. We capture a new dataset called RICH for "Real scenes, Interaction, Contact and Humans." RICH contains multiview outdoor/indoor video sequences at 4K resolution, ground-truth 3D human bodies captured using markerless motion capture, 3D body scans, and high resolution 3D scene scans. A key feature of RICH is that it also contains accurate vertex-level contact labels on the body. Using RICH, we train a network that predicts dense body-scene contacts from a single RGB image. Our key insight is that regions in contact are always occluded so the network needs the ability to explore the whole image for evidence. We use a transformer to learn such non-local relationships and propose a new Body-Scene contact TRansfOrmer (BSTRO). Very few methods explore 3D contact; those that do focus on the feet only, detect foot contact as a post-processing step, or infer contact from body pose without looking at the scene. To our knowledge, BSTRO is the first method to directly estimate 3D body-scene contact from a single image. We demonstrate that BSTRO significantly outperforms the prior art. The code and dataset are available at https://rich.is.tue.mpg.de.

연구 동기 및 목표

  • 훈련 및 벤치마킹를 위한 고품질의 밀도 높고 정점 수준의 인간-환경 접촉 레이블이 포함된 데이터셋의 부족을 해결하기 위해.
  • 가림을 극복하기 위해 전반적인 이미지 컨텍스트를 활용하여 단일 RGB 이미지에서 3D 전신 접촉을 추론하는 방법을 개발하기 위해.
  • 현재 방법들이 대부분 忽시하는 환경 접촉 정보를 통합함으로써 3D 신체 자세 및 형태 추정을 향상시키기 위해.
  • 환경 접촉이 단일 영상 기반 3D 인간 자세 추정의 과제를 어떻게 증가시키는지, 특히 가림 상황에서 어떻게 어려움을 야기하는지 입증하기 위해.
  • 미래의 공동 신체-형태-환경 접촉 추정 및 동적 상호작용 모델링 작업의 기초를 마련하기 위해.

제안 방법

  • RICH 데이터셋은 다중 시점 4K 카메라, 마커리스 모션 캡처, 레이저 스캔을 이용한 3D 환경 스캔을 통해 수집되어 정점 수준의 접촉 레이블링을 정확하게 수행할 수 있도록 한다.
  • 최소한의 의복을 입은 주체의 고해상도 3D 신체 스캔을 사용하여 SMPL-X 신체 모델을 피팅함으로써 진정한 신체 형태와 자세를 제공한다.
  • 비국소적 이미지 관계를 영상 전반에 걸쳐 장거리 관계를 모델링하기 위해 다층 트랜스포머를 사용하는 새로운 Body-Scene contact TRansfOrmer(BSTRO)를 제안한다.
  • BSTRO는 RICH 데이터셋에서 엔드 투 엔드로 훈련되어 단일 RGB 이미지에서 이미지 증거를 활용하여 SMPL-X 신체 메esh의 조밀한 3D 접촉을 회귀함으로써, 가림 상황에서도 정확한 예측을 수행한다.
  • 네트워크 아키텍처는 전체 영상에 대한 주의를 기반으로 환경 컨텍스트를 활용하고, 가림 영역에서도 접촉을 추론할 수 있도록 설계되어 있다.
  • 평가에는 정밀도, 재현율, F1, 기하 오차 지표를 사용하며, 환경 접촉이 자세 추정에 미치는 영향을 분석하기 위한 아블레이션 스터디를 실시한다.

실험 결과

연구 질문

  • RQ1전체 이미지 컨텍스트를 활용하여 가림을 극복하고 단일 이미지에서 조밀하고 정점 수준의 인간-환경 접촉을 정확하게 예측할 수 있는가?
  • RQ2의미 있는 환경 접촉의 존재가 단일 영상 기반 3D 인간 자세 및 형태 추정 성능에 어떤 영향을 미치는가?
  • RQ3단순히 신체 자세나 환경 기하학적 정보 외에 이미지 증거를 사용할 경우, 접촉 예측 정확도는 어느 정도 향상되는가?
  • RQ4복잡하고 가려진 환경에서 접촉 추론을 위해 트랜스포머 기반 아키텍처가 비국소적 관계를 효과적으로 모델링할 수 있는가?
  • RQ5기존 기술 대비 접촉 탐지 및 인간 자세 추정 정확도 측면에서 제안된 방법은 어떻게 비교되는가?

주요 결과

  • BSTRO는 RICH-테스트 세트에서 접촉 예측 F1 스코어 70.8%를 기록하여 Zou et al. [105] (35.9%) 및 POSA [28] (진정한 신체를 사용한 경우 46.4%)와 같은 기존 방법들을 크게 앞서간다.
  • 의미 있는 환경 접촉이 있는 이미지는 없는 경우보다 더 높은 MPJPE(214.0mm TR-MPJPE)와 V2V(172.81mm TR-V2V) 오차를 보이며, 접촉이 자세 추정의 과제를 증가시킨다는 것을 시사한다.
  • 움직이는 카메라 상황에서 접촉이 존재할 경우 PA-MPJPE와 PA-V2V 오차는 각각 84.15mm와 83.16mm이며, 존재하지 않을 경우는 각각 63.67mm와 64.37mm로, 접촉이 자세 추정에 미치는 도전 과제를 확인한다.
  • BSTRO의 성능은 서브셋 전반에서 뛰어난 일반화 능력을 보이며, 훈련 시 환경과 주체를 모두 관찰한 경우 F1 76.9%, 속성 정보가 전혀 없는 경우 F1 72.1%를 기록한다.
  • 아블레이션 스터디는 환경 접촉이 단일 영상 기반 3D 인간 자세 추정에서 주요 오차 원인임을 확인하며, 복잡한 가림과 모호한 신호를 유발하기 때문이다.
  • RICH 데이터셋은 고해상도 이미지, 3D 환경 스캔, 정점 수준의 접촉 레이블을 제공함으로써, 단일 영상 기반 3D 인간-환경 접촉 추정에 대한 첫 번째 벤치마크를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.