Skip to main content
QUICK REVIEW

[논문 리뷰] Pixel-wise Regression: 3D Hand Pose Estimation via Spatial-form Representation and Differentiable Decoder

Xingyuan Zhang, Fuhai Zhang|arXiv (Cornell University)|2019. 05. 06.
Human Pose and Action Recognition참고 문헌 27인용 수 4
한 줄 요약

이 논문은 3D 손 자세 추정을 위한 새로운 픽셀 단위 회귀 프레임워크를 제안하며, 공간형상 표현(SFR)과 미분 가능한 디코더를 결합하여 공간적 구조를 유지하고 3D 관절 좌표에 직접적인 감독을 가능하게 한다. 3D 좌표를 평면 및 깊이 성분으로 분리하고 별도의 평면 회귀(Plane Regression) 및 깊이 회귀(Depth Regression) 모듈을 사용함으로써, MSRA 데이터셋에서 평균 3D 오차를 25% 감소시켜 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

3D Hand pose estimation from a single depth image is an essential topic in computer vision and human-computer interaction. Although the rising of deep learning method boosts the accuracy a lot, the problem is still hard to solve due to the complex structure of the human hand. Existing methods with deep learning either lose spatial information of hand structure or lack a direct supervision of joint coordinates. In this paper, we propose a novel Pixel-wise Regression method, which use spatial-form representation (SFR) and differentiable decoder (DD) to solve the two problems. To use our method, we build a model, in which we design a particular SFR and its correlative DD which divided the 3D joint coordinates into two parts, plane coordinates and depth coordinates and use two modules named Plane Regression (PR) and Depth Regression (DR) to deal with them respectively. We conduct an ablation experiment to show the method we proposed achieve better results than the former methods. We also make an exploration on how different training strategies influence the learned SFRs and results. The experiment on three public datasets demonstrates that our model is comparable with the existing state-of-the-art models and in one of them our model can reduce mean 3D joint error by 25%.

연구 동기 및 목표

  • 완전 연결 층에서의 평탄화 연산으로 인해 회귀 기반 3D 손 자세 추정에서 공간 정보가 손실되는 문제를 해결하기 위해.
  • 비미분 가능한 디코더에 의존하는 검출 기반 방법에서 3D 관절 좌표에 대한 직접적인 감독이 부족한 문제를 해결하기 위해.
  • 공간적 구조를 유지하면서도 직접적인 3D 좌표 감독을 통해 엔드 투 엔드 학습이 가능한 공간형상 표현(SFR)을 설계하기 위해.
  • 자기 음영 및 깊이 노이즈와 같은 도전적인 조건에서도 3D 손 자세 추정의 정확도를 향상시키기 위해.
  • 공개 데이터셋에서의 추론 및 벤치마크 평가를 통해 미분 가능한 디코딩과 SFR 설계의 효과를 입증하기 위해.

제안 방법

  • 3D 관절 좌표를 2D 특징 맵으로 인코딩하는 공간형상 표현(SFR)을 도입하여 손의 전반적인 공간적 구조를 유지한다.
  • SFR에서 3D 관절 좌표를 직접 재구성할 수 있도록 설계된 미분 가능한 디코더(DD)를 제안하여, 3D 감독을 통한 엔드 투 엔드 학습을 가능하게 한다.
  • 디코더는 평면 회귀(PR) 모듈(2D (u,v) 좌표용)과 깊이 회귀(DR) 모듈(깊이(z) 값용)로 분리된 평행한 두 모듈로 구성된다.
  • SFR는 완전 컨volution 네트워크(FCN)를 통해 학습되며, DD는 네트워크 내부의 학습 가능한 레이어로 구현되어 전체 파이프라인을 통한 역전파가 가능하다.
  • 예측된 3D 관절 좌표와 진짜값 간의 L2 오차를 최소화하는 복합 손실 함수를 사용하여 모델을 훈련시킨다.
  • 기존의 비미분 가능한 디코더를 사용하는 검출 기반 방법과 달리, 공간적 인덕티브 바이어스를 유지하면서도 3D 좌표에 직접적인 감독을 가능하게 한다.

실험 결과

연구 질문

  • RQ1미분 가능한 디코더를 통해 관절 좌표에 대한 직접적인 감독이 가능해지면 3D 손 자세 추정 정확도가 향상되는가?
  • RQ2공간형상 표현(SFR)을 통해 공간적 구조를 유지함으로써 3D 손 자세 추정의 일반화 능력 향상과 오차 감소가 이루어지는가?
  • RQ3SFR 설계와 그에 따른 미분 가능한 디코더의 상호작용이 자기 음영 및 깊이 노이즈가 있는 어려운 데이터셋에서 성능에 어떤 영향을 미치는가?
  • RQ4학습 전략의 선택이 학습된 SFR의 품질과 최종 3D 자세 추정 정확도에 어느 정도의 영향을 미치는가?
  • RQ5제안된 픽셀 단위의 회귀 프레임워크가 정확도와 내구성 측면에서 기존의 회귀 기반 및 검출 기반 방법을 모두 초월할 수 있는가?

주요 결과

  • MSRA 데이터셋에서 제안된 방법은 평균 3D 오차 5.186 mm를 기록하여 이전 최신 기술 수준 대비 25% 감소시켰다.
  • MSRA에서 평균 오차와 임계값 이하 오차를 보인 프레임 비율 측면에서 모든 베이스라인을 능가했으며, 특히 고정밀 영역에서 두드러진 성능을 보였다.
  • ICVL 데이터셋에서 평균 3D 오차는 6.177 mm로, 최고 성능을 보인 모델(V2V-PoseNet, 6.284 mm)과 유사했으며, 10 mm 이하 임계값을 충족하는 데서도 다른 모델들을 능가했다.
  • HAND17 데이터셋에서 평균 오차는 12.22 mm로, 베이스라인(19.71 mm)보다 유의미하게 향상되었지만, 최고 성능 모델보다는 약간 열등했다.
  • 제거 분석 결과, 미분 가능한 디코더를 통한 직접 감독이 핵심임을 확인했으며, SFR 설계가 특히 음영을 띤 관절에서 성능에 큰 영향을 미친다.
  • 정성적 결과에서는 모델이 잘 일반화되었음을 보여주며, 일부 예측 값이 진짜값 애너테이션을 초월하기까지 했는데, 이는 단순 암기 외에도 강력한 특징 학습 능력을 지녔음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.