Skip to main content
QUICK REVIEW

[논문 리뷰] SMAP: Single-Shot Multi-Person Absolute 3D Pose Estimation

Jianan Zhen, Qi Fang|arXiv (Cornell University)|2020. 08. 26.
Human Pose and Action Recognition참고 문헌 44인용 수 5
한 줄 요약

SMAP는 단일 RGB 이미지에서 다수의 사람에 대한 절대 3D 자세 추정을 위한 단일 스텝, 바닥에서부터 시작하는 프레임워크를 제안한다. 이는 새로운 루트 깊이 맵과 깊이 인식 파트 연관 기법을 활용하여 사람 간의 깊이 관계를 모델링하고 3D 및 2D 자세 정확도를 향상시킨다. CMU Panoptic과 MuPoTS-3D에서 최신 기술 수준의 성능을 달성하며, 겹침과 척도 모호성에 대한 강건성을 향상시켜 실외 영상으로의 일반화 성능도 향상시킨다.

ABSTRACT

Recovering multi-person 3D poses with absolute scales from a single RGB image is a challenging problem due to the inherent depth and scale ambiguity from a single view. Addressing this ambiguity requires to aggregate various cues over the entire image, such as body sizes, scene layouts, and inter-person relationships. However, most previous methods adopt a top-down scheme that first performs 2D pose detection and then regresses the 3D pose and scale for each detected person individually, ignoring global contextual cues. In this paper, we propose a novel system that first regresses a set of 2.5D representations of body parts and then reconstructs the 3D absolute poses based on these 2.5D representations with a depth-aware part association algorithm. Such a single-shot bottom-up scheme allows the system to better learn and reason about the inter-person depth relationship, improving both 3D and 2D pose estimation. The experiments demonstrate that the proposed approach achieves the state-of-the-art performance on the CMU Panoptic and MuPoTS-3D datasets and is applicable to in-the-wild videos.

연구 동기 및 목표

  • 단일 RGB 이미지에서 깊이 및 척도 모호성이 정확한 재구성에 장애가 되는 다수의 사람에 대한 절대 3D 자세 추정 문제를 해결하기 위해.
  • 상향식 방법이 전역적 맥락을 忽시하는 한계를 극복하기 위해, 신체 크기, 환경 레이아웃, 사람 간 관계와 같은 이미지 전반의 단서를 통합하는 하향식 접근 방식을 제안하기 위해.
  • 특히 겹침 또는 겹쳐진 상황에서 사람 간 깊이 관계를 명시적으로 모델링하여 3D 자세 추정 성능을 향상시키기 위해.
  • 2D 관절 히트맵, 파트 유사성 필드, 상대 깊이 맵, 루트 깊이 맵을 동시에 회귀하는 통합된 단일 프로세싱 단계 프레임워크를 개발하여 3D 자세 일致성 향상시키기 위해.

제안 방법

  • 모델은 완전 컨volution 네트워크를 사용해 루트 깊이 맵을 추론하며, 3D 자세 애너테이션을 지도로 사용해 입력 이미지에서 각 사람의 루트 관절 깊이를 직접 예측한다.
  • 하향식 방식으로 신체 부위 간의 국소화 및 연관을 위해 2D 관절 히트맵과 파트 유사성 필드(PAF)를 동시에 예측한다.
  • 각 신체 부위의 두 관절 간 상대 깊이를 인코딩하는 새로운 파트 상대 깊이 맵을 도입하여, 파트 연관 과정에서 깊이 인식 추론을 가능하게 한다.
  • 깊이 인식 파트 연관 알고리즘은 예측된 깊이 정보를 활용해 겹침을 해결하고 현실적인 뼈 길이 제약 조건을 강제하여 관절 그룹화 정확도를 향상시킨다.
  • 최종적으로 2D 관절 연관 결과와 예측된 루트 깊이, 상대 깊이 맵을 조합하여 일관된 절대 3D 위치를 재구성한다.
  • 전체 파이프라인은 엔드 투 엔드 방식으로 훈련되어 이미지 전반에 걸친 깊이 관련 단서를 전역적으로 학습할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1전역적 이미지 맥락과 깊이 단서를 활용하여 단일 스텝, 바닥에서부터 시작하는 프레임워크가 다수의 사람에 대한 절대 3D 자세 추정에 효과적으로 기여할 수 있는가?
  • RQ2이미지에서 직접 신체 깊이를 예측하는 것이 후행적 깊이 회귀 대비 3D 자세 추정 및 파트 연관에 어떤 영향을 미치는가?
  • RQ3깊이 인식 파트 연관 기법이 겹침 또는 겹쳐진 인간 신체에서 오류를 어느 정도 줄일 수 있는가?
  • RQ4제안된 방법이 실외 영상으로 일반화되어 CMU Panoptic 및 MuPoTS-3D와 같은 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5루트 깊이 및 상대 깊이 지도가 전체 3D 자세 추정 정확도에 기여하는 정도는 어느 정도인가?

주요 결과

  • SMAP는 CMU Panoptic 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, PCK@0.2 절대 정확도는 89.2%이며, Human3.6M에서 평균 MPJPE는 54.1 mm를 기록하였다.
  • MuPoTS-3D 데이터셋에서 SMAP는 PCK rel 점수 80.5%와 PCK abs 점수 38.7%를 기록하였으며, 순서 기반 및 일치된 진짜값 평가 모두에서 이전 방법들을 능가하였다.
  • 제거 실험 결과, 루트 깊이 지도 추가로 PCK root는 29.9% (2D 전용)에서 45.5%로 향상되어 깊이 지도의 가치를 입증하였다.
  • 깊이 인식 파트 연관 알고리즘이 깊이 예측을 활용해 모호성을 해소함으로써 겹침 상황에서의 관절 연관 오류를 감소시켰다.
  • 루트 깊이, 상대 깊이, 2D 브랜치를 모두 포함한 전체 모델은 MuPoTS-3D 데이터셋에서 92.3%의 리콜률을 기록하여, 루트 깊이 전용 변형(85.0% 리콜)보다 뚜렷이 뛰어난 성능을 보였다.
  • qualitative 결과를 통해 SMAP는 다수의 사람과 겹침이 있는 제약 없는 복잡한 장면에서 실외 영상으로도 잘 일반화됨을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.