Skip to main content
QUICK REVIEW

[논문 리뷰] Graph-Based 3D Multi-Person Pose Estimation Using Multi-View Images

Size Wu, Sheng Jin|arXiv (Cornell University)|2021. 09. 13.
Human Pose and Action Recognition인용 수 6
한 줄 요약

이 논문은 다중 시야 영상에서 3D 다수인간 자세 추정을 위한 새로운 그래프 기반, 군집에서 세밀한 방식의 프레임워크를 제안한다. 작업에 특화된 그래프 신경망을 사용하여 정확도와 효율성을 향상시킨다. 세 가지 모듈—MMG(학습 가능한 다중 시야 매칭을 위한 모듈), CRG(지속적인 3D 중심 정밀 조정을 위한 모듈), PRG(구조적이고 기하학적으로 인지하는 자세 정밀 조정을 위한 모듈)를 도입하여 계산량과 메모리 사용을 크게 줄이며 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

This paper studies the task of estimating the 3D human poses of multiple persons from multiple calibrated camera views. Following the top-down paradigm, we decompose the task into two stages, i.e. person localization and pose estimation. Both stages are processed in coarse-to-fine manners. And we propose three task-specific graph neural networks for effective message passing. For 3D person localization, we first use Multi-view Matching Graph Module (MMG) to learn the cross-view association and recover coarse human proposals. The Center Refinement Graph Module (CRG) further refines the results via flexible point-based prediction. For 3D pose estimation, the Pose Regression Graph Module (PRG) learns both the multi-view geometry and structural relations between human joints. Our approach achieves state-of-the-art performance on CMU Panoptic and Shelf datasets with significantly lower computation complexity.

연구 동기 및 목표

  • 기존의 2D에서 3D로의 변환 방법과 직접적인 3D 추정 방법의 한계를 해결하기 위해 다중 시야 영상 기반 3D 다수인간 자세 추정에서의 문제를 다루는 것.
  • 다양한 시야 간의 학습 가능한 기하학적 인지 기반 특징 융합을 통해 가림과 정확하지 않은 2D 검출에 대한 강건성을 향상시키는 것.
  • 보체 기반의 체적 방법과 비교해 계산 비용과 메모리 사용을 줄이면서도 정확도를 유지하거나 향상시키는 것.
  • 그래프 신경망을 사용해 군집에서 세밀한 인간 중심 탐지와 3D 자세 정밀 조정을 통합한 통합형 엔드 투 엔드 프레임워크를 개발하는 것.

제안 방법

  • 군집 3D 인간 중심 탐지에 적합한 다중 시야 매칭을 수행하기 위해 시각적 및 기하학적 신호를 융합하는 학습 가능한 그래프 네트워크인 다중 시야 매칭 그래프 모듈(MMG)을 도입한다.
  • 지속적인 3D 공간에서 작동하는 점 기반 그래프 네트워크인 중심 정밀 조정 그래프 모듈(CRG)을 제안한다. 이 모듈은 암시적 필드 표현과 적응형 샘플링을 사용해 인간 중심 위치를 정밀 조정한다.
  • 인간 신체의 구조적 사전 지식과 다중 시야 기하 제약 조건을 동시에 모델링하는 그래프 기반 모델인 자세 회귀 그래프 모듈(PRG)을 설계한다. 이 모듈은 3D 관절 위치를 정밀 조정한다.
  • 두 단계의 군집에서 세밀한 파이프라인을 활용한다. 첫 번째 단계에서는 MMG를 통해 인간 후보를 탐지하고 CRG로 정밀 조정하며, 두 번째 단계에서는 기준 3D 회귀기로부터의 초기 추정치를 사용해 PRG로 3D 자세를 회귀한다.
  • 다중 시야 특징을 효과적으로 집계하기 위해 그래프 신경망을 활용하여 기존의 평균화나 고정 격자 방법보다 나은 특징 융합을 가능하게 한다.
  • CRG에서 암시적 필드 표현을 활용해 양자화 오차를 방지하고 탄력적인 샘플링을 허용함으로써 정확도와 추론 속도 사이의 균형을 이루도록 한다.
Figure 1: Overview of mainstream multi-view 3D pose estimation frameworks. (a) 2D-to-3D lifting-based approaches (b) Direct 3D pose estimation approaches. (c) Our approach applies graph-based matching algorithm to detect human centers, and applies a graph-based pose refinement model to effectively u
Figure 1: Overview of mainstream multi-view 3D pose estimation frameworks. (a) 2D-to-3D lifting-based approaches (b) Direct 3D pose estimation approaches. (c) Our approach applies graph-based matching algorithm to detect human centers, and applies a graph-based pose refinement model to effectively u

실험 결과

연구 질문

  • RQ1학습 가능한 그래프 기반 다중 시야 매칭이 수작업으로 정의된 기하학적 및 외관 제약 조건보다 3D 인간 중심 탐지 정확도를 향상시킬 수 있는가?
  • RQ2그래프 네트워크를 통한 지속적이고 점 기반의 3D 정밀 조정이 이산적인 보체 기반 국소화 방식보다 정확도와 효율성 면에서 뛰어나게 될 수 있는가?
  • RQ3신체 구조와 다중 시야 기하를 동시에 모델링하는 그래프 기반 자세 정밀 조정 모듈이 3D 자세 추정 정확도를 크게 향상시킬 수 있는가?
  • RQ4제안된 프레임워크는 기존의 체적 및 2D에서 3D로의 변환 방법과 비교해 계산 비용과 메모리 사용을 얼마나 줄일 수 있으며, 성능을 유지하거나 향상시킬 수 있는가?

주요 결과

  • 제안된 방법은 CMU Panoptic 및 Shelf 데이터셋에서 최신 기술 수준의 성능을 달성했으며, 평균 정밀도(mAP)는 82.10%, 평균 관절 위치 오차(MPJPE)는 15.84mm를 기록했다.
  • MMG 모듈은 데이터 기반 학습을 통해 다중 시야 간의 인물 매칭을 향상시켜 전통적인 수작업 기반 매칭 기준을 초월했다.
  • CRG 모듈은 보체 기반 기준 대비 메모리 사용량을 95% 감소시켰으며, 인당 1.08MB 메모리와 5.6ms의 추론 시간을 사용했다.
  • PRG 모듈은 다양한 초기 회귀기에서 일관되게 3D 자세 정확도를 향상시켰으며, 평균적으로 MPJPE를 7.3%에서 8.2%까지 감소시켰다.
  • 단지 $32^3$개의 보체 박스만을 사용함으로써 제안된 방법은 MPJPE 15.95mm를 달성했으며, Tu 등 [35]의 방법보다 1.84mm 우수했고, 계산 비용은 1/4로 줄였다.
  • 프레임워크는 높은 효율성을 유지한다. 단일 GPU에서 MMG는 인당 2.4ms, CRG는 5.6ms 소요되며, 4명의 사람에 대해 총 추론 시간은 65ms 이내다.
Figure 2: Overview of our approach. The whole pipeline follows the top-down paradigm. It first applies Multi-view Matching Graph Module (MMG) to obtain coarse human center candidates, which are used to limit the search space. Center Refinement Graph Module (CRG) adaptively performs point-based predi
Figure 2: Overview of our approach. The whole pipeline follows the top-down paradigm. It first applies Multi-view Matching Graph Module (MMG) to obtain coarse human center candidates, which are used to limit the search space. Center Refinement Graph Module (CRG) adaptively performs point-based predi

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.