Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-View Multi-Person 3D Pose Estimation with Plane Sweep Stereo

Jiahao Lin, Gim Hee Lee|arXiv (Cornell University)|2021. 04. 06.
Human Pose and Action Recognition참고 문헌 23인용 수 4
한 줄 요약

이 논문은 다중 시야 다중 인물 3D 자세 추정을 위한 평면 스weep 스테레오 기반 방법을 제안하며, 명시적 다중 시야 대응 매칭 없이 직접 관절의 깊이를 회귀한다. 평면 스위핑을 통한 시야 간 기하학적 일관성과 코arse-to-fine 깊이 회귀 기법을 활용함으로써, 기존의 학습 기반 방법들 중 VoxelPose와 비교해 최대 20배 빠른 속도를 기록하면서도 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

Existing approaches for multi-view multi-person 3D pose estimation explicitly establish cross-view correspondences to group 2D pose detections from multiple camera views and solve for the 3D pose estimation for each person. Establishing cross-view correspondences is challenging in multi-person scenes, and incorrect correspondences will lead to sub-optimal performance for the multi-stage pipeline. In this work, we present our multi-view 3D pose estimation approach based on plane sweep stereo to jointly address the cross-view fusion and 3D pose reconstruction in a single shot. Specifically, we propose to perform depth regression for each joint of each 2D pose in a target camera view. Cross-view consistency constraints are implicitly enforced by multiple reference camera views via the plane sweep algorithm to facilitate accurate depth regression. We adopt a coarse-to-fine scheme to first regress the person-level depth followed by a per-person joint-level relative depth estimation. 3D poses are obtained from a simple back-projection given the estimated depths. We evaluate our approach on benchmark datasets where it outperforms previous state-of-the-arts while being remarkably efficient. Our code is available at https://github.com/jiahaoLjh/PlaneSweepPose.

연구 동기 및 목표

  • 다중 시야 다중 인물 3D 자세 추정에서 발생하는 다중 시야 대응 매칭 문제를 해결하기 위해, 이는 다단계 파이프라인에서 성능 저하를 초래하는 오류에 취약하다.
  • 명시적 매칭 대신 기하학적 일관성을 통한 다중 시야 정보의 통합을 통해 종단 간 단일 스포트 3D 자세 추정을 가능하게 하기 위해.
  • 3D 볼륨 기반 방법들인 VoxelPose와 비교해 계산 효율성을 향상시키기 위해, 희박한 시나리오에서의 3D 컨벌루션 비용을 줄이기 위해.
  • 3D 시나리오 볼륨이나 카메라 레이아웃에 대한 사전 지식 없이도 다양한 카메라 구성에 일반화할 수 있도록 하기 위해.
  • 암시적 다중 시야 일관성을 활용한 코어스-투-파인 계획을 통해 각 2D 자세 관절의 깊이 회귀 정확도를 향상시키기 위해.

제안 방법

  • 목표 카메라 시야에서 각 2D 자세 관절의 깊이 회귀를 평면 스위프 스테레오 기법을 사용해 수행하며, 가상의 깊이 평면을 후방 투영하고 기준 시야로 왜곡한다.
  • 각 깊이 수준에서 시야 간 일관성을 측정하기 위해, 왜곡된 특징을 시야 간 비교함으로써 깊이 회귀 네트워크를 안내한다.
  • 두 단계의 코어스-투-파인 깊이 추정 기법을 적용: 먼저 인물 수준의 깊이를 추정하고, 그 다음 좁은 범위 내에서 관절 수준의 상대 깊이를 추정한다.
  • 깊이 예측 결과를 사용해 2D 자세를 3D 공간으로 후방 투영하고, 다중 시야 간 거리 기반 클러스터링을 통해 3D 자세를 통합한다.
  • 전체 볼륨 공간에 대한 3D 컨벌루션 대신 각 2D 자세에 대해 1D 컨벌루션을 사용함으로써 계산 비용을 크게 감소시킨다.
  • 전체 파이프라인이 종단 간으로 훈련되며, 명시적 2D 자세 매칭이나 삼각측량이 필요하지 않다.

실험 결과

연구 질문

  • RQ1다중 시야 다중 인물 3D 자세 추정에서 2D 자세 검출의 관절 수준 깊이 회귀에 평면 스위프 스테레오 기법을 효과적으로 적용할 수 있는가?
  • RQ2코어스-투-파인 깊이 추정 기법은 정확도를 향상시키면서도 계산 효율성을 유지할 수 있는가?
  • RQ3복잡한 시나리오에서 평면 스위핑을 통한 암시적 다중 시야 일관성이 명시적 다중 시야 대응 매칭을 능가하는가?
  • RQ43D 시나리오 레이아웃에 대한 사전 지식 없이도 다양한 카메라 구성에 일반화될 수 있는가?
  • RQ53D 볼륨 기반 접근 방식보다 훨씬 낮은 추론 비용으로 최신 기준 성능(SOTA)을 달성할 수 있는가?

주요 결과

  • Campus 데이터셋에서 평균 정확도 97.0%를 기록하여 이전 최신 기준(SOTA)의 96.7%에서 향상되었다.
  • Shelf 데이터셋에서 평균 정확도 97.9%를 달성하여 이전 방법의 97.4%에서 향상되었다.
  • CMU Panoptic 데이터셋에서 MPJPE를 16.75mm로 줄여 VoxelPose의 17.68mm 대비 0.93mm 향상되었다.
  • VoxelPose 대비 최대 20배 빠른 추론 속도를 기록하여 실시간 응용에 적합한 프레임 레이트를 확보했다.
  • 단 두 대의 카메라 조합에서도 92% 이상의 정확도를 유지하여 저조도 환경에서도 뛰어난 내성성을 입증했다.
  • 랜덤 카메라 조합으로 훈련하고 고정된 카메라 조합으로 테스트했을 때도 유사한 성능을 기록하며 다양한 카메라 구성에 잘 일반화됨을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.