Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Graph Reasoning for Multi-person 3D Pose Estimation

Zhongwei Qiu, Qiansheng Yang|arXiv (Cornell University)|2022. 07. 22.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 다중 인물 3D 자세 추정을 위한 새로운 바닥에서부터의 접근 방식인 GR-M3D를 제안한다. 이는 다중 루트 관절 키포인트와 조밀한 경로로부터 적응적으로 디코딩 그래프를 구성하는 동적 그래프 추론(DGR)을 사용하여 가림과 깊이 모호성에 대한 강건성을 향상시킨다. 스케일과 깊이 인식 보정(SDAR) 모듈을 통합함으로써 GR-M3D는 세 가지 벤치마크에서 최신 기술 성능을 달성하였으며, 기준 방법 대비 3.2%의 상대적 향상도를 보이며 3DPCK에서 승리한다.

ABSTRACT

Multi-person 3D pose estimation is a challenging task because of occlusion and depth ambiguity, especially in the cases of crowd scenes. To solve these problems, most existing methods explore modeling body context cues by enhancing feature representation with graph neural networks or adding structural constraints. However, these methods are not robust for their single-root formulation that decoding 3D poses from a root node with a pre-defined graph. In this paper, we propose GR-M3D, which models the extbf{M}ulti-person extbf{3D} pose estimation with dynamic extbf{G}raph extbf{R}easoning. The decoding graph in GR-M3D is predicted instead of pre-defined. In particular, It firstly generates several data maps and enhances them with a scale and depth aware refinement module (SDAR). Then multiple root keypoints and dense decoding paths for each person are estimated from these data maps. Based on them, dynamic decoding graphs are built by assigning path weights to the decoding paths, while the path weights are inferred from those enhanced data maps. And this process is named dynamic graph reasoning (DGR). Finally, the 3D poses are decoded according to dynamic decoding graphs for each detected person. GR-M3D can adjust the structure of the decoding graph implicitly by adopting soft path weights according to input data, which makes the decoding graphs be adaptive to different input persons to the best extent and more capable of handling occlusion and depth ambiguity than previous methods. We empirically show that the proposed bottom-up approach even outperforms top-down methods and achieves state-of-the-art results on three 3D pose datasets.

연구 동기 및 목표

  • 고정된 루트 디코딩 그래프의 한계를 해결함으로써, 특히 가림과 깊이 모호성 상황에서의 3D 다중 인물 자세 추정의 성능을 향상시키기 위해.
  • 신체 부위가 자주 가려지고 스케일 변화가 큰 혼잡한 장면에서의 강건성을 향상시키기 위해.
  • 단일 루트 노드에 의존하는 것이 아니라, 여러 잠재적 관절 경로를 고려하는 동적이고 데이터에 적응하는 디코딩 메커니즘을 개발하기 위해.
  • 인간 검출 또는 인스턴스 연관 단계를 포함하지 않는 코스트가 높은 상향식 검출 단계에 의존하지 않고도 최신 기술 성능을 달성하기 위해.

제안 방법

  • 스케일과 깊이 인식 보정(SDAR) 모듈을 도입하여 관절 히트맵, 스케일 맵, 깊이 맵, 3D 오프셋 맵을 향상시켜 기능 표현을 개선한다.
  • 향상된 기능 맵에서 다중 루트 관절 키포인트와 조밀한 디코딩 경로를 예측함으로써 다중 루트 기반 추론이 가능해진다.
  • 예측된 디코딩 경로에 학습된 소프트 가중치를 할당하여 각 사람마다 적응적인 그래프 구조를 갖는 동적 디코딩 그래프를 구성한다.
  • 동적 그래프 추론(DGR) 메커니즘은 향상된 기능 맵에서 경로 가중치를 추론하여 3D 자세 디코딩 중에 맥락 인식이 가능하고 적응적인 메시지 전달을 가능하게 한다.
  • 전체 프레임워크는 상향식 파라다임을 사용하여 인간 검출 또는 인스턴스 연관이 필요 없으며, Hourglass, ResNet, HRNet와 같은 다양한 백본과 호환된다.
  • 전체 파이프라인이 엔드 투 엔드로 훈련 가능하며, ResNet-101 및 HRNet-32와 같은 무거운 백본을 사용할 때에도 실시간 추론을 달성한다.

실험 결과

연구 질문

  • RQ1가림과 깊이 모호성 상황에서 3D 다중 인물 자세 추정을 다룰 때, 고정된 구조의 그래프(예: 별형 또는 트리형)보다 동적이고 데이터에 적응하는 디코딩 그래프가 성능을 더 뛰어나게 할 수 있는가?
  • RQ2학습된 경로 가중치를 갖는 다중 루트 기반 추론은 단일 루트 디코딩 전략에 비해 성능을 얼마나 향상시키는가?
  • RQ3스케일과 깊이를 동시에 모델링하는 보정 모듈이 관절 예측 품질과 후속 디코딩 품질을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 동적 그래프 추론 메커니즘은 실제 세계의 제약 없이 혼잡한 장면에 일반화되는가?
  • RQ5동적 그래프 추론을 갖는 바닥에서부터의 접근 방식이 상향식 방법과 비교해 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • GR-M3D는 Hourglass 백본을 사용하여 MuPoTS-3D 데이터셋에서 84.6의 3DPCK 성능을 달성하였으며, 이는 이전 최신 기술 성능을 초월한다.
  • Human3.6M 데이터셋에서 GR-M3D는 동일한 백본을 사용할 때 기준 방법 대비 MPJPE에서 5%의 상대적 향상과 PA MPJPE에서 16%의 향상을 기록하였다.
  • 혼잡도 지수 0.7 이상의 혼잡한 장면에서 GR-M3D는 기준 방법 대비 5.9%의 상대적 향상을 보이며 강력한 가림에 대한 강건성을 입증하였다.
  • MuCo-3DHP 데이터셋에서 GR-M3D는 이전 최신 기술 성능 방법 대비 각각 $PCK_{rel}$, $PCK_{abs}$, $AUC_{rel}$에서 2.5%, 6.5%, 3.3%의 상대적 향상을 기록하였다.
  • GR-M3D는 ResNet-101 및 HRNet-32와 같은 무거운 백본을 사용할 때에도 실시간 추론 속도(15–23 fps)를 유지하며, 기준 방법 대비 오직 2MB의 파라미터 증가만을 보였다.
  • 모델은 제한 없이 실제 세계의 이미지로 일반화가 잘 되었으며, COCO 데이터셋과 같은 3D 애너테이션 없이도 타당한 3D 자세 예측을 생성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.