Skip to main content
QUICK REVIEW

[논문 리뷰] BEHAVE: Dataset and Method for Tracking Human Object Interactions

Bharat Lal Bhatnagar, Xianghui Xie|arXiv (Cornell University)|2022. 04. 14.
Human Pose and Action Recognition인용 수 6
한 줄 요약

BEHAVE는 다중 시점 RGBD 카메라를 사용하여 자연 환경에서 인간-물체 상호작용의 3D 추적을 위한 첫 번째 데이터셋과 방법을 제안한다. SMPL을 통해 인간을, 템플릿 메쉬를 통해 물체를 추적하고, 대응 관계와 부호 없는 거리 필드를 예측함으로써 표면 접촉을 명시적으로 추적한다. 이는 노이즈, 음영, 불완전한 데이터 조건에서도 뛰어난 성능을 발휘하며, 이전의 IP-Net 및 LoopReg와 같은 방법들보다 정확도와 효율성에서 뛰어나다.

ABSTRACT

Modelling interactions between humans and objects in natural environments is central to many applications including gaming, virtual and mixed reality, as well as human behavior analysis and human-robot collaboration. This challenging operation scenario requires generalization to vast number of objects, scenes, and human actions. Unfortunately, there exist no such dataset. Moreover, this data needs to be acquired in diverse natural environments, which rules out 4D scanners and marker based capture systems. We present BEHAVE dataset, the first full body human- object interaction dataset with multi-view RGBD frames and corresponding 3D SMPL and object fits along with the annotated contacts between them. We record around 15k frames at 5 locations with 8 subjects performing a wide range of interactions with 20 common objects. We use this data to learn a model that can jointly track humans and objects in natural environments with an easy-to-use portable multi-camera setup. Our key insight is to predict correspondences from the human and the object to a statistical body model to obtain human-object contacts during interactions. Our approach can record and track not just the humans and objects but also their interactions, modeled as surface contacts, in 3D. Our code and data can be found at: http://virtualhumans.mpi-inf.mpg.de/behave

연구 동기 및 목표

  • 자연 환경에서 인간-물체 상호작용을 위한 대규모 실세계 데이터셋이 부족한 문제를 해결하기 위해.
  • 저비용이고 이동성이 뛰어난 다중 카메라 설정을 사용하여 인간, 물체, 그들의 물리적 접촉을 정확하게 3D로 추적할 수 있도록 하기 위해.
  • 상호작용 도중 자주 발생하는 노이즈, 불완전한 깊이 데이터, 음영 문제를 해결하기 위해.
  • 신경망이 예측한 대응 관계와 부호 없는 거리 필드를 활용하여 강건한 정렬을 위한 공동 피팅 프레임워크를 개발하기 위해.
  • 연구를 가속화하기 위해 공개된 데이터셋과 코드베이스를 제공하기 위해.

제안 방법

  • 이동성이 뛰어나고 소비자용 카메라를 사용한 다중 시점 RGBD 설정을 활용하여 자연 환경에서의 상호작용를 촬영한다.
  • 인간 표현을 위해 파arametric한 SMPL 신체 모델을, 물체 모델링을 위해 3D 템플릿 메쉬를 사용한다.
  • 3D 쿼리 포인트에서 SMPL 표면으로의 대응 관계 필드와 인간 및 물체 표면에 대한 부호 없는 거리 필드를 예측한다.
  • 30,000개의 쿼리 포인트만으로도 사용 가능한, 미분 가능한 암묵적 정렬 손실을 도입하여 Marching Cubes와 같은 고비용 절차를 피한다.
  • 물리적으로 타당한 상호작용을 보장하고 떠 있는 물체를 방지하기 위해 접촉 예측을 핵심 감독 신호로 통합한다.
  • 형태 복구, 대응 관계, 접촉 예측을 통합한 공동 최적화 목표 함수를 활용하여 누락된 데이터와 노이즈에 강건한 성능을 확보한다.
Figure 1 : Given a multi-view RGBD sequence, our method tracks the human, the object and their contacts in 3D.
Figure 1 : Given a multi-view RGBD sequence, our method tracks the human, the object and their contacts in 3D.

실험 결과

연구 질문

  • RQ1신경망 기반 방법이 다중 시점 RGBD 입력만으로 자연 환경에서 인간, 물체, 그들의 표면 접촉을 공동으로 추적할 수 있는가?
  • RQ2대응 관계 예측과 부호 없는 거리 필드는 음영과 불완전한 깊이 데이터에 대한 강건성을 어떻게 향상시킬 수 있는가?
  • RQ3접촉 예측이 추적된 인간-물체 상호작용의 물리적 타당성을 크게 향상시킬 수 있는가?
  • RQ4실제 노이즈와 누락된 데이터 조건에서 최신 기술인 IP-Net 및 LoopReg와 비교해 본다면, 제안된 방법의 정확도와 효율성은 어떻게 평가될 수 있는가?
  • RQ5학습된, 미분 가능한 정렬 프레임워크는 전통적인 비미분 가능한 복원 파이프라인(예: Marching Cubes)을 얼마나 효과적으로 대체할 수 있는가?

주요 결과

  • 제안된 방법은 IP-Net보다 정확도와 효율성에서 뛰어나며, IP-Net가 약 200만 개의 쿼리 포인트가 필요한 데 비해 본 방법은 단지 30,000개의 쿼리 포인트만으로도 충분하며, Marching Cubes가 필요 없어진다.
  • LoopReg는 표면 포인트에만 의존하기 때문에 불완전한 포인트 클라우드에서 실패하는 데 비해, 본 방법은 음영과 노이즈에 대해 훨씬 뛰어난 강건성을 확보한다.
  • 접촉 예측은 물리적으로 타당한 추적에 필수적이다. 이를 생략할 경우 물체가 떠 있거나 신체와 잘못 대칭되는 경우가 자주 발생한다.
  • BEHAVE 데이터셋은 8명의 주체, 20개의 물체, 5개의 다양한 장소에서 촬영한 15,200帧의 다중 시점 RGBD 시퀀스를 포함하며, 현재까지 가장 큰 벤치마크로 평가된다.
  • 본 방법은 마커 기반 시스템이나 제한된 운동 캡처 공간에 의존하지 않고도, 이동성 있고 저비용의 RGBD 카메라만으로도 인간-물체 상호작용의 정확한 3D 추적을 가능하게 한다.
  • 공개된 코드와 데이터셋은 향후 인간-물체 상호작용 모델링 연구를 촉진할 것으로 기대되며, 단일 시점 및 다중 시점 추적, 자세 추정, 3D 복원 분야의 새로운 기준이 될 것이다.
BEHAVE: Dataset and Method for Tracking Human Object Interactions

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.