Skip to main content
QUICK REVIEW

[논문 리뷰] HDNet: Human Depth Estimation for Multi-Person Camera-Space Localization

Jiahao Lin, Gim Hee Lee|arXiv (Cornell University)|2020. 07. 17.
Human Pose and Action Recognition참고 문헌 30인용 수 6
한 줄 요약

HDNet는 2D 자세 추정과 깊이 회귀를 함께 학습함으로써 카메라 좌표계에서 다중 인물 3D 자세 추정의 절대 루트 관절 깊이를 추정하는 엔드 투 엔드 딥 러닝 프레임워크이다. 히트맵 유도 특징 풀링, 관절 간 기반 그래프 신경망(GNN)을 통한 특징 전파 및 깊이 추정을 이진 분류 작업으로 설정하고 소프트-아르그맥스를 활용하여 정확도를 향상시켰다. 이로 인해 다양한 지표에서 Human3.6M 및 MuPoTS-3D에서 이전 최고 성능(SOTA)을 능가하였다.

ABSTRACT

Current works on multi-person 3D pose estimation mainly focus on the estimation of the 3D joint locations relative to the root joint and ignore the absolute locations of each pose. In this paper, we propose the Human Depth Estimation Network (HDNet), an end-to-end framework for absolute root joint localization in the camera coordinate space. Our HDNet first estimates the 2D human pose with heatmaps of the joints. These estimated heatmaps serve as attention masks for pooling features from image regions corresponding to the target person. A skeleton-based Graph Neural Network (GNN) is utilized to propagate features among joints. We formulate the target depth regression as a bin index estimation problem, which can be transformed with a soft-argmax operation from the classification output of our HDNet. We evaluate our HDNet on the root joint localization and root-relative 3D pose estimation tasks with two benchmark datasets, i.e., Human3.6M and MuPoTS-3D. The experimental results show that we outperform the previous state-of-the-art consistently under multiple evaluation metrics. Our source code is available at: https://github.com/jiahaoLjh/HumanDepth.

연구 동기 및 목표

  • 다중 인물 3D 자세 추정에서 루트 기반 관절 위치에만 집중하는 경향이 있으므로, 절대 3D 국소화의 부족을 해결하기 위함이다.
  • 인간 신체 사전 지식과 관절 히트맵을 주의 마스크로 활용하여 단안 영상에서 루트 관절 깊이 추정 정확도를 향상시키기 위함이다.
  • 2D 자세 추정과 절대 깊이 회귀를 함께 최적화하는 엔드 투 엔드 프레임워크를 개발하여 국소화 정확도와 후속 3D 자세 추정 정확도를 향상시키기 위함이다.
  • 기존 방법이 깊이 추정에 바운딩 박스 크기에 의존하는 데서 비롯되는 자세 변화에 민감하고 검출기의 일관성 부족 문제를 해결하기 위함이다.

제안 방법

  • HDNet는 먼저 히트맵을 사용하여 2D 인간 자세를 추정하고, 이를 주의 마스크로 활용하여 각 관절 유형에 맞는 이미지 특징을 풀링한다.
  • 자세 인식 특징은 신체 관절 기반 그래프 신경망(GNN)에 입력되며, 이는 신체 관절 간 특징을 전파하고 정제하여 깊이 추정을 향상시킨다.
  • 깊이 추정은 사전 정의된 박스로 깊이를 이산화하여 분류 작업으로 설정함으로써 안정적인 학습과 더 나은 일반화를 가능하게 한다.
  • 네트워크는 이진 분류 출력을 연속적인 깊이 예측으로 변환하기 위해 소프트-아르그맥스 연산을 사용하여 수렴성과 정밀도를 향상시킨다.
  • 다중 척도 특징 피라미드 네트워크(FPN)를 사용하여 풍부한 특징을 추출하며, 자세 및 깊이 추정을 위한 별도의 브랜치를 두어 특징 상관관계 편향을 방지한다.
  • 모든 구성 요소를 공동 최적화하는 방식으로 2D 자세 추정 및 깊이 분류를 위한 병합 손실을 사용하여 엔드 투 엔드로 학습한다.

실험 결과

연구 질문

  • RQ12D 자세 추정과 깊이 회귀를 엔드 투 엔드 프레임워크에서 효과적으로 통합하여 절대 3D 자세 국소화 정확도를 향상시킬 수 있는가?
  • RQ2관절 히트맵을 특징 풀링의 주의 마스크로 사용할 경우, 전역 풀링 또는 바운딩 박스 기반 방법에 비해 깊이 추정 정확도가 향상되는가?
  • RQ3신체 관절 기반 GNN이 관절 간 특징을 효과적으로 전파하고 정제하여 깊이 추정을 향상시킬 수 있는가?
  • RQ4딥스피드 회귀를 이진 분류 작업으로 설정하고 소프트-아르그맥스를 사용하는 것이 직접 회귀보다 단안 깊이 추정에서 더 효과적인가?
  • RQ5향상된 루트 관절 국소화는 후속 루트 기반 3D 자세 추정 작업에서 성능 향상에 기여하는가?

주요 결과

  • Human3.6M 데이터셋에서 HDNet는 평균 상대 백분율 오차(MRPE_z)를 69.9 mm로 기록하여 이전 SOTA인 RootNet보다 38.2 mm 향상되었다.
  • MuPoTS-3D 데이터셋에서 HDNet는 25 mm 이내 정밀도 평균(AP₂₅^root)을 39.4%로 기록하여 RootNet의 31.0% 대비 8.4% 향상되었다.
  • 제거 실험 결과, GNN 구성 요소가 완전 연결 층보다 오차를 3 mm 감소시켜 특징 전파에서의 효과성을 입증하였다.
  • 히트맵 기반 풀링을 제거할 경우 MRPE_z는 1.9 mm 증가하고 AP₂₅^root는 13.4% 감소하여 선택적 특징 집계에서의 중요성을 입증하였다.
  • 직접 깊이 회귀는 이진 분류보다 성능이 열 劣하며, MRPE_z가 14.2 mm 높게 나타나 분류 기반 접근의 유용성을 검증하였다.
  • 향상된 루트 국소화로 루트 기반 3D 자세 추정 성능이 향상되었으며, 평균 3DPCK_rel이 이전 SOTA 대비 1.2% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.