[논문 리뷰] Occlusion-aware Hand Pose Estimation Using Hierarchical Mixture Density Network
이 논문은 자기 음영을 고려하여 3D 손 자세 추정을 조건부 확률 분포로 모델링하는 엔드 투 엔드 학습 가능한 프레임워크인 계층적 혼합 밀도 네트워크(HMDN)를 제안한다. 두 수준의 계층 구조를 통해 가시 관절은 단일 가우시안으로, 음영 관절은 가우시안 혼합 모델로 모델링함으로써 다중 모달 자세 분포를 포착하여, 상태 기반 기법보다 훨씬 뛰어난 성능을 보이며 음영이 많은 벤치마크에서 다양하고 해석 가능한 후보 샘플을 생성한다.
Learning and predicting the pose parameters of a 3D hand model given an image, such as locations of hand joints, is challenging due to large viewpoint changes and articulations, and severe self-occlusions exhibited particularly in egocentric views. Both feature learning and prediction modeling have been investigated to tackle the problem. Though effective, most existing discriminative methods yield a single deterministic estimation of target poses. Due to their single-value mapping intrinsic, they fail to adequately handle self-occlusion problems, where occluded joints present multiple modes. In this paper, we tackle the self-occlusion issue and provide a complete description of observed poses given an input depth image by a novel method called hierarchical mixture density networks (HMDN). The proposed method leverages the state-of-the-art hand pose estimators based on Convolutional Neural Networks to facilitate feature learning, while it models the multiple modes in a two-level hierarchy to reconcile single-valued and multi-valued mapping in its output. The whole framework with a mixture of two differentiable density functions is naturally end-to-end trainable. In the experiments, HMDN produces interpretable and diverse candidate samples, and significantly outperforms the state-of-the-art methods on two benchmarks with occlusions, and performs comparably on another benchmark free of occlusions.
연구 동기 및 목표
- 단일 결정론적 출력을 생성하고 음영 하에서 다중 모달 자세 분포를 모델링하지 못하는 판별적 손 자세 추정 방법의 한계를 해결한다.
- 최소 제곱 오차로 훈련하는 동안 여러 진짜 자세를 평균화함으로써 발생하는 음영 관절에 대한 물리적으로 비현실적인 예측을 해결한다.
- 특히 자주 발생하는 자기 음영을 포함한 이콜로지컬 시각에서 입력 깊이 이미지에 조건부된 완전한 확률적 손 자세 기술을 제공한다.
- 다양한 밀도 함수를 사용하여 특징을 동시에 학습하고 복잡한 다중 모달 자세 분포를 모델링하는 딥 네트워크의 엔드 투 엔드 학습을 가능하게 한다.
- 단일 순방향 전파에서 다양한 운동학적으로 타당한 자세 가설을 생성함으로써 추적 및 다단계 추정과 같은 후행 작업을 지원한다.
제안 방법
- 관절 위치 분포를 두 수준으로 모델링하는 계층적 혼합 밀도 네트워크(HMDN)를 도입한다. 첫 번째로, 은닉 가시성 변수는 관절이 가시한지 음영인지 결정한다.
- 가시 관절의 경우, HMDN은 조건부 관절 위치 분포를 모델링하기 위해 단일 가우시안 분포(SGN)를 사용한다.
- 음영 관절의 경우, HMDN은 동일한 입력 이미지에 대해 여러 타당한 자세 구성이 가능한 가우시안 혼합 모델(GMM)을 활용한다.
- HMDN 프레임워크는 CNN 기반 특징 추출기 위에 쌓여 있으며, 이로 인해 다양한 밀도 함수를 사용한 엔드 투 엔드 학습이 가능하다.
- 네트워크는 예측된 혼합 분포 하에서 진짜 자세의 가능도를 최적화하는 음수 로그 가능도 손실을 사용하여 훈련된다.
- 추론 단계에서는 HMDN이 음영 관절의 GMM에서 샘플링하고 가시 관절의 SGN에서 샘플링함으로써 다양한 후보 자세를 생성하여 불확실성 하에서도 강력한 자세 추정을 가능하게 한다.
실험 결과
연구 질문
- RQ1딥 러닝 프레임워크는 음영이 있는 손 관절에 대해 유연하고 엔드 투 엔드 학습 가능한 방식으로 다중 모달 자세 분포를 모델링할 수 있는가?
- RQ2가시성을 은닉 변수로 모델링함으로써 자기 음영 하에서 3D 손 자세 추정의 정확도와 다양성은 어떻게 향상되는가?
- RQ3계층적 혼합 밀도 접근 방식은 단일 분포 기반 베이스라인(SGN) 및 기존의 다중 가설 기반 방법보다 정확도와 샘플 다양성 측면에서 뛰어나게 성능을 발휘하는가?
- RQ4HMDN은 음영 정도가 다양한 벤치마크에서 어떻게 성능을 발휘하는가? 특히 상태 기반 결정론적 및 생성 기반 방법과 비교하여 어떻게 되는가?
- RQ5HMDN의 확률적 출력은 다양한 타당한 자세 가설을 제공함으로써 추적 또는 하이브리드 자세 추정과 같은 후행 작업의 성능을 향상시킬 수 있는가?
주요 결과
- MSHD 데이터셋에서 음영이 상당히 많은 경우, HMDN은 최신 기법들보다 뚜렷이 뛰어난 성능을 보였다. 특히 음영 관절의 경우 두드러진 성능 향상이 있었다.
- MSHD 벤치마크에서 HMDN는 8개의 가우시안 성분을 사용했을 때 음영 관절의 평균 오차가 11.8 mm로, Tang 등 [12] (14.2 mm)와 Ye 등 [31] (15.1 mm)를 모두 앞섰다. 이는 100개의 샘플을 사용한 경우였다.
- HMDN은 HMDN hard 및 HMDN soft 변형보다 일관되게 낮은 오차를 기록했으며, 성분 수가 다양할수록 HMDN soft가 가장 우수한 성능를 보였다.
- 음영이 덜 발생하는 NYU 데이터셋에서는 HMDN이 SGN과 유사한 성능을 보였으며, 가시 관절에서는 두 번째, 음영 관절에서는 세 번째로 높은 순위를 기록하여 낮은 음영 환경에서도 강건함을 입증했다.
- HMDN이 생성한 샘플은 다양성과 정확성이 모두 뛰어나며, Tang 등 [12]가 결합 트리 포레스트에 GMM를 사용한 것처럼 높은 분산을 보이는 것과는 달리, 분포가 매우 좁다.
- 시각적 비교 결과, HMDN의 샘플은 Ye 등 [31]과 Tang 등 [12]의 결과보다 특히 음영 관절에서 진짜 자세에 더 가까운 것으로 확인되었으며, 이는 진정한 다중 모달 분포를 모델링할 수 있음을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.