Skip to main content
QUICK REVIEW

[논문 리뷰] Ray3D: ray-based 3D human pose estimation for monocular absolute 3D localization

Yu Zhan, Fenghai Li|arXiv (Cornell University)|2022. 03. 22.
Human Pose and Action Recognition인용 수 7
한 줄 요약

Ray3D는 2D 키포인트 검출을 3D 정규화된 광선으로 변환하여 카메라 내재 매개변수를 분리하고, 학습된 임bedding을 통해 카메라 외재 매개변수(예: 높이 및 피치)를 명시적으로 모델링하는 새로운 단안 3D 인간 자세 추정 방법을 제안한다. 이 설계는 카메라 내재 및 외재 매개변수 변화에 대한 최신 기술 수준의 일반화 성능을 가능하게 하며, 3DHP에서 307.4 mm의 MRPE를 기록하여 다양한 벤치마크에서 기존 최고 성능(SOTA) 방법을 초월한다.

ABSTRACT

In this paper, we propose a novel monocular ray-based 3D (Ray3D) absolute human pose estimation with calibrated camera. Accurate and generalizable absolute 3D human pose estimation from monocular 2D pose input is an ill-posed problem. To address this challenge, we convert the input from pixel space to 3D normalized rays. This conversion makes our approach robust to camera intrinsic parameter changes. To deal with the in-the-wild camera extrinsic parameter variations, Ray3D explicitly takes the camera extrinsic parameters as an input and jointly models the distribution between the 3D pose rays and camera extrinsic parameters. This novel network design is the key to the outstanding generalizability of Ray3D approach. To have a comprehensive understanding of how the camera intrinsic and extrinsic parameter variations affect the accuracy of absolute 3D key-point localization, we conduct in-depth systematic experiments on three single person 3D benchmarks as well as one synthetic benchmark. These experiments demonstrate that our method significantly outperforms existing state-of-the-art models. Our code and the synthetic dataset are available at https://github.com/YxZhxn/Ray3D .

연구 동기 및 목표

  • 스케일, 깊이 및 카메라 매개변수에 대한 모호성으로 인해 단안 절대 3D 인간 자세 추정 문제가 잘 정의되지 않은 문제를 해결한다.
  • 실세계 환경에서 카메라 내재 매개변수(초점 거리, 주요점) 및 외재 매개변수(피치, 높이, 요)의 변화에 걸쳐 일반화 성능을 향상시킨다.
  • 기존의 리프팅 및 이미지 기반 방법이 매개변수 변화를 처리하지 못하거나 시야 변화에 취약한 점을 극복한다.
  • 네트워크에 校정된 카메라 외재 매개변수를 명시적으로 통합하여 메트릭 공간 내 정확한 절대 3D 위치 추정을 가능하게 한다.
  • 스케일, 카메라 자세 및 깊이의 제어된 변화 하에서 합성 및 실세계 벤치마크를 체계적으로 평가하여 안정성과 일반화 능력을 검증한다.

제안 방법

  • 카메라에 종속되지 않는 공간에서 2D 키포인트 좌표를 3D 정규화된 광선으로 변환하여 모델이 카메라 내재 매개변수로부터 분리되도록 한다.
  • 연속 프레임 간의 3D 광선을 시간적 컬러블을 적용하여 융합함으로써 가림 및 노이즈 상황에서의 정확도를 향상시키고 안정성을 높인다.
  • 카메라 높이 및 피치를 입력으로 받는 다층 퍼셉트론(MLP) 기반의 카메라 임베딩 모듈을 도입하여 외재 매개변수 분포를 모델링한다.
  • 시간적으로 융합된 광선 특징과 카메라 임베딩을 연결하여 세계 좌표계에서 정확한 3D 키포인트 회귀를 유도한다.
  • 정규화를 통해 내재 매개변수를 분리하여 초점 거리 및 주요점 변화 상황에서도 안정적인 성능을 확보한다.
  • 실제 벤치마크(H36M, 3DHP, MPI-INF-3DWP)와 제어된 매개변수 변화가 포함된 자체 설계한 합성 데이터셋을 모두 활용해 훈련 및 평가한다.

실험 결과

연구 질문

  • RQ12D 키포인트를 3D 정규화된 광선으로 변환하는 것이 초점 거리 및 주요점과 같은 카메라 내재 매개변수 변화에 대해 얼마나 안정성을 향상시키는가?
  • RQ2카메라 외재 매개변수(예: 높이 및 피치)를 명시적으로 모델링하는 것이 다양한 카메라 자세에 걸쳐 일반화 능력을 얼마나 향상시키는가?
  • RQ3신체 스케일 및 카메라-주체 거리의 극단적 변화 상황에서 기존 SOTA 기준선 대비 제안된 방법의 성능은 어떠한가?
  • RQ4광선의 시간적 융합이 가림 및 노이즈 상황에서 정확도 및 안정성 향상에 기여하는 정도는 어떠한가?
  • RQ5내재 매개변수 분리와 카메라 임베딩이 개별 및 통합적으로 교차 데이터셋 일반화 성능에 미치는 영향은 어떠한가?

주요 결과

  • Ray3D는 H36M에서 훈련된 후 3DHP 데이터셋에서 307.4 mm의 MRPE를 기록하여 RIE 기준선(1079.2 mm) 및 기타 SOTA 방법을 모두 초월한다.
  • 모든 테스트된 카메라 내재 매개변수 변화(초점 거리, 주요점) 상황에서도 안정적인 성능 유지를 보이며, 성능 저하가 최소한이다.
  • 카메라 피치 각도 변화 상황에서도 Ray3D는 -30°에서 +30°까지 일관된 정확도를 유지하며 기존 기준선을 크게 능가한다.
  • 카메라 이동(주체로부터의 거리) 상황에서는 5미터 거리에서도 Ray3D는 낮은 오차(800 mm 이내 MRPE)를 유지하지만, 기존 기준선은 급격히 성능이 떨어진다.
  • 신체 스케일 변화(0.6×에서 1.1×) 상황에서는 Ray3D의 MRPE가 800 mm로 증가하지만, 여전히 기준선들(예: PoseFormer 및 RIE는 최대 4미터)에 비해 훨씬 낮은 오차를 기록한다.
  • 제거 실험 결과, 내재 매개변수 분리, 카메라 정규화, 카메라 임베딩 각각이 기여도가 높으며, 전체 모델이 가장 우수한 교차 데이터셋 일반화 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.