Skip to main content
QUICK REVIEW

[논문 리뷰] PoseLifter: Absolute 3D human pose lifting network from a single noisy 2D human pose

Ju Yong Chang, Gyeongsik Moon|arXiv (Cornell University)|2019. 10. 26.
Human Pose and Action Recognition인용 수 9
한 줄 요약

PoseLifter는 2D 자세의 노이즈가 있는 단일 뷰를 카메라 좌표계 내 절대 3D 자세로 올리는 데 전용으로 설계된 딥 러닝 네트워크입니다. 정규화된 2D 자세, 2D 위치, 2D 스케일을 사용하여 루트의 절대 깊이와 루트 기준 3D 자세를 동시에 추정함으로써, 훈련 중 실제 2D 자세 추정 오차를 반영하고 캐논리컬 깊이 정규화를 통해 초점 거리의 모호성을 해결함으로써 2D에서 3D 자세로의 변환 및 3D 인간 자세 추정에서 최신 기술 수준의 성능을 달성합니다.

ABSTRACT

This study presents a new network (i.e., PoseLifter) that can lift a 2D human pose to an absolute 3D pose in a camera coordinate system. The proposed network estimates the absolute 3D location of a target subject and generates an improved 3D relative pose estimation compared with existing pose-lifting methods. Using the PoseLifter with a 2D pose estimator in a cascade fashion can estimate a 3D human pose from a single RGB image. In this case, we empirically prove that using realistic 2D poses synthesized with the real error distribution of 2D body joints considerably improves the performance of our PoseLifter. The proposed method is applied to public datasets to achieve state-of-the-art 2D-to-3D pose lifting and 3D human pose estimation.

연구 동기 및 목표

  • 기존 방법이 상대 3D 자세만 생성하는 데서 비롯되는 카메라 좌표계 내에서 2D 인간 자세를 절대 3D 자세로 올리는 문제의 불완전성 문제를 해결하기 위해.
  • 2D 자세 추정기와 새로운 3D 자세 올리기 네트워크를 조합하여 단일 RGB 이미지에서 3D 인간 자세 추정 성능을 향상시키기 위해.
  • 단일 이미지 2D에서 3D로의 변환에서 알려지지 않은 주체 크기와 카메라 초점 거리로 인해 발생하는 절대 깊이 추정의 모호성을 해결하기 위해.
  • 실제 2D 자세 추정기에서 발생하는 오차 분포를 반영한 합성 2D 자세로 훈련하여 성능을 향상시키기 위해.
  • 오브제クト 검출기와 PoseLifter를 연결한 캐스케이드 구조를 통해 제약 없는, 실외 환경에서도 강력한 3D 자세 추정을 가능하게 하기 위해.

제안 방법

  • PoseLifter는 정규화된 2D 자세, 2D 관절 위치, 2D 스케일의 세 가지 입력을 사용하여 루트 관절의 절대 3D 좌표와 루트 기준 3D 자세를 동시에 추정합니다.
  • 모델은 초점 거리로 정규화된 캐논리컬 깊이 표현을 사용하여 알려지지 않은 초점 거리와 주체 크기로 인한 절대 깊이 추정의 모호성을 해소합니다.
  • 2D 위치와 스케일을 활용하여 투영의 기하학적 모호성을 줄이고, 루트 기준 3D 자세 추정 성능을 향상시킵니다.
  • 실제 2D 자세 추정기의 오차 분포를 반영한 합성 2D 자세로 훈련하여, 실제 2D 자세 추정 출력에 더 잘 일반화되도록 합니다.
  • 사전 훈련된 2D 자세 추정기(예: COCO 또는 MPII에서 유래)와 PoseLifter를 조합한 캐스케이드 파이프라인을 통해 단일 RGB 이미지에서 엔드 투 엔드 3D 인간 자세 추정을 수행합니다.
  • 네트워크 아키텍처는 단일 순방향 전파에서 절대 루트 깊이(캐논리컬 깊이를 통해)와 상대 3D 자세를 동시에 회귀하도록 설계되어 있습니다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 카메라 좌표계 내에서 절대 3D 자세로 2D 인간 자세를 올릴 수 있는가, 단지 상대 3D 자세로만 올리는가?
  • RQ2단일 2D 이미지만 제공될 경우 절대 깊이 추정의 불완전성 문제를 어떻게 완화할 수 있는가?
  • RQ3실제 오차 분포를 반영한 합성 2D 자세를 사용하면 3D 자세 올리기 네트워크의 일반화 능력과 성능 향상에 기여하는가?
  • RQ4캐논리컬 깊이 표현 방식이 실세계 데이터셋에서 다양한 카메라 초점 거리로 인한 모호성을 효과적으로 해결할 수 있는가?
  • RQ5제안된 PoseLifter가 제약 없는 환경에서 단일 RGB 이미지에서 3D 인간 자세 추정에서 최신 기술 수준의 성능를 달성할 수 있는가?

주요 결과

  • PoseLifter는 Human3.6M 데이터셋에서 3D PCK 점수 81.6%를 기록하여 이전 최고 성능 방법들을 능가합니다.
  • MPI-INF-3DHP 데이터셋에서 3D PCK 점수 83.9%와 MRPE 217.4 mm를 달성하여 모든 기존 접근 방식을 뛰어넘습니다.
  • 제거 실험 결과, 캐논리컬 깊이 표현을 제거할 경우 MPI-INF-3DHP 데이터셋에서 MRPE가 296.9 mm로 증가하여, 초점 거리 모호성을 해소하는 데의 중요성을 입증합니다.
  • 실제 오차 분포를 반영한 합성 2D 자세로 훈련하면 성능 향상이 뚜렷하게 나타나며, 현실적인 노이즈를 사용할 경우 MRPE가著 감소합니다.
  • COCO 데이터셋의 실외 이미지에 대해서도 잘 일반화되어 있으며, 가림, 다양한 시점 등 복잡한 환경에서도 3D 자세를 성공적으로 추정합니다.
  • 정성적 결과는 스튜디오, 실외, 제약 없는 환경을 포함한 다양한 자세와 환경에서 정확하고 자연스러운 3D 자세 추정을 보여줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.