[논문 리뷰] Two-hand Global 3D Pose Estimation Using Monocular RGB
이 논문은 깊이 센서 없이 단일 단일 RGB 영상에서 양손의 3D 전역 관절 위치를 추정하는 데 있어 최초의 시스템을 제안한다. 다단계 CNN 파이프라인과 새로운 투영 알고리즘을 사용하여 절대 3D 자세를 복원한다. 이는 3D 표준 자세 추정에서 최신 기술 수준의 성능을 달성하며, 대규모 합성 이고세트릭 데이터셋을 사용해 전역 3D 손 자세 추정을 위한 새로운 벤치마크를 제안한다.
We tackle the challenging task of estimating global 3D joint locations for both hands via only monocular RGB input images. We propose a novel multi-stage convolutional neural network based pipeline that accurately segments and locates the hands despite occlusion between two hands and complex background noise and estimates the 2D and 3D canonical joint locations without any depth information. Global joint locations with respect to the camera origin are computed using the hand pose estimations and the actual length of the key bone with a novel projection algorithm. To train the CNNs for this new task, we introduce a large-scale synthetic 3D hand pose dataset. We demonstrate that our system outperforms previous works on 3D canonical hand pose estimation benchmark datasets with RGB-only information. Additionally, we present the first work that achieves accurate global 3D hand tracking on both hands using RGB-only inputs and provide extensive quantitative and qualitative evaluation.
연구 동기 및 목표
- 오염, 배경 노이즈, 깊이 정보 부족 등의 과제를 극복하면서 단일 RGB 입력만을 사용하여 정확한 3D 전역 손 자세 추정을 가능하게 하기 위해.
- 두 손의 3D 자세 추정을 위한 대규모 실세계 레이블 데이터 부족 문제를 해결하기 위해 고품질의 합성 이고세트릭 데이터셋을 구축하기 위해.
- 2D 및 3D 표준 자세에서 절대 3D 관절 위치를 복원하는 데 있어 시점에 영향을 받지 않는 새로운 투영 알고리즘을 개발하기 위해.
- RGB 입력만을 사용하는 3D 전역 손 자세 추정을 위한 새로운 평가 프로토콜과 벤치마크를 수립하기 위해.
제안 방법
- 다단계 CNN 파이프라인: (1) 손 세그멘테이션 및 탐지, (2) 2D 손 자세 추정, (3) 3D 표준 자세 추정, (4) 투영을 통한 3D 전역 자세 추정.
- 절대 3D 관절 위치를 추정된 3D 표준 자세, 2D 관절 위치 및 알려진 뼈 길이를 사용하여 계산하는 새로운 전역 투영 알고리즘.
- 정적 및 동적 손 자세를 포함한 합성 이고세트릭 RGB-D 데이터셋을 사용하여 훈련하여 실제 환경의 시야 조건을 시뮬레이션한다.
- 2D 및 3D 표준 자세 성능에 약간의 저하가 있음에도 불구하고 전역 자세 추정 정확도를 향상시키는 데 기여하는 새로운 손실 함수 $\mathcal{L}_{proj}$ 사용.
- 2D 및 3D 자세 추정 정확도를 향상시키기 위해 손 세그멘테이션 및 배치 정규화 레이어 통합.
- 전역 자세 추정 평가를 위해 구면 좌표 기반 평가를 사용하여 루트 관절의 방향성 및 거리 정확도를 평가한다 (mMCP).
실험 결과
연구 질문
- RQ1깊이 또는 다중 시점 데이터 없이 단일 RGB 입력만을 사용하여 양손의 3D 전역 손 자세 추정을 정확하게 수행할 수 있는가?
- RQ2깊이 정보가 없을 경우 2D 및 3D 표준 자세에서 절대 3D 관절 위치를 어떻게 복원할 수 있는가?
- RQ3실제 텍스처와 시점 변화를 반영한 현실적인 합성 이고세트릭 데이터셋이 실세계 RGB 데이터로의 일반화를 얼마나 잘 가능하게 하는가?
- RQ4다양한 손실 함수 및 네트워크 구성 요소가 2D, 3D 표준 자세 및 전역 3D 자세 추정 정확도에 어떤 영향을 미치는가?
- RQ5제안된 방법은 표준 및 전역 3D 자세 추정 벤치마크에서 최신 기술 수준의 접근 방식과 비교해 어떻게 성능를 발휘하는가?
주요 결과
- 제안된 방법은 전역 3D 자세 추정에서 $Ego3D_{s}$-test 및 $Ego3D_{d}$-test 데이터셋에서 각각 3° 각도 임계값 및 7 cm 반경 임계값에서 약 0.90의 구면 PCK를 달성한다.
- 추가적인 깊이 또는 다중 시점 데이터를 사용하는 최신 기술 수준의 단일 손 3D 표준 자세 추정 방법들보다도 성능가 뛰어나며, 오직 RGB 입력만을 사용하고 있음에도 불구하고 성능가 확보한다.
- $\mathcal{L}_{proj}$ 손실 사용으로 전역 자세 추정 정확도가 향상되었으며, 표준 자세 AUC 및 EPE에 약간의 감소가 있었음에도 불구하고 구면 PCK가 증가하였다.
- STB 데이터셋에서 루트 관절 위치의 진짜값에 접근할 수 없음에도 불구하고, 3° 및 7 cm 임계값에서 0.90의 구면 PCK를 달성하여 실세계 데이터로의 일반화 능력을 입증하였다.
- RHP 데이터셋에서 방위각($\theta$)에 대해 AUC 0.960, 고도각($\phi$)에 대해 0.958, 반경에 대해 0.690을 기록하여 강력한 방향 정확도를 보였지만 깊이 추정 향상 여지가 있음을 시사하였다.
- 제거 실험을 통해 손 세그멘테이션 및 배치 정규화가 2D 및 3D 자세 추정 성능 향상에 크게 기여했으며, $\mathcal{L}_{bone}$을 사용함으로써 평균 뼈 길이 오차가 3.7mm에서 1.8mm로 감소하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.