Skip to main content
QUICK REVIEW

[논문 리뷰] Dense 3D Regression for Hand Pose Estimation

Chengde Wan, Thomas Probst|arXiv (Cornell University)|2017. 11. 24.
Human Pose and Action Recognition참고 문헌 38인용 수 3
한 줄 요약

이 논문은 다중 작업 CNN 캐스케이드를 통해 2D/3D 관절 히트맵과 단위 3D 방향 벡터장에 대해 모델링함으로써 단일 깊이 프레임에 대한 밀도 높은 3D 회귀 방법을 제안한다. 이 방법은 평균 이동 변종을 사용하여 픽셀 단위 투표를 집계하면서 2D 및 3D 예측 간 일관성을 강제하여, MSRA, NYU, ICVL 데이터셋에서 각각 평균 오차 7.2mm, 10.2mm, 7.3mm로 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

We present a simple and effective method for 3D hand pose estimation from a single depth frame. As opposed to previous state-of-the-art methods based on holistic 3D regression, our method works on dense pixel-wise estimation. This is achieved by careful design choices in pose parameterization, which leverages both 2D and 3D properties of depth map. Specifically, we decompose the pose parameters into a set of per-pixel estimations, i.e., 2D heat maps, 3D heat maps and unit 3D directional vector fields. The 2D/3D joint heat maps and 3D joint offsets are estimated via multi-task network cascades, which is trained end-to-end. The pixel-wise estimations can be directly translated into a vote casting scheme. A variant of mean shift is then used to aggregate local votes while enforcing consensus between the the estimated 3D pose and the pixel-wise 2D and 3D estimations by design. Our method is efficient and highly accurate. On MSRA and NYU hand dataset, our method outperforms all previous state-of-the-art approaches by a large margin. On the ICVL hand dataset, our method achieves similar accuracy compared to the currently proposed nearly saturated result and outperforms various other proposed methods. Code is available $\href{"https://github.com/melonwan/denseReg"}{ ext{online}}$.

연구 동기 및 목표

  • 단일 깊이 프레임에 대한 수체적 3D 회귀 및 2D 검출의 한계를 해결하기 위해.
  • 깊이 맵의 2D 및 3D 기하학적 특성을 융합하여 손 자세 변형, 이동 변형, 자가 음영에 대한 강건성을 향상시키기 위해.
  • 통합된 밀도 높은 픽셀 단위 추정 프레임워크를 통해 관절 검출 및 3D 회귀의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 이산적 볼륨 표현에 대한 의존도를 줄이고 3D CNN의 계산 부담과 모호성을 피하기 위해.

제안 방법

  • 절대 좌표가 아닌 픽셀 단위 3D 오프셋으로 3D 관절 위치를 재정의하여 이동 불변성을 확보하기 위해.
  • 각 픽셀에 대해 2D 관절 히트맵, 3D 관절 히트맵(3D 거리 기반), 단위 3D 방향 벡터장 예측하기.
  • 모든 세 가지 구성 요소를 동시에 회귀하기 위해 다중 작업, 엔드 투 엔드 학습 가능한 CNN 캐스케이드 사용하기.
  • 히트맵과 벡터장에서 유래한 局부 투표를 집계하기 위해 비모수적 평균 이동 변종 적용하며, 2D 및 3D 예측 간 일관성 강제하기.
  • 최종 자세 추정에서 기하학적 일관성을 강제하는 투표 기반 기반의 2D 검출 및 3D 회귀 통합하기.
  • 깊이 맵의 2.5D 성격을 활용하여 국소 패턴 학습을 위한 2D CNN과 최종 자세 회귀를 위한 3D 기하학적 추론을 결합하기.

실험 결과

연구 질문

  • RQ1히트맵과 방향성 필드를 기반으로 한 2D 및 3D 관절 성질의 밀도 높은 픽셀 단위 추정은 수체적 회귀 대비 3D 손 자세 추정 정확도를 향상시킬 수 있는가?
  • RQ23D CNN을 사용하지 않고도 깊이 맵의 2D 및 3D 기하학적 사전 지식을 딥 러닝 프레임워크에서 효과적으로 융합할 수 있는가?
  • RQ3히트맵과 방향성 필드를 기반으로 한 투표 캐스팅 집계 기반의 방법이 자가 음영 및 자세 변형에 대한 강건성을 향상시킬 수 있는가?
  • RQ4단위 벡터장 기반 오프셋 회귀는 다양한 손 자세에 걸쳐 학습 안정성과 일반화 성능을 향상시키는 데 어느 정도 기여하는가?
  • RQ5일관된 투표 메커니즘을 통해 2D 검출과 3D 회귀를 통합하면 계단식 또는 공유 특징 기반 접근 방식을 초월할 수 있는가?

주요 결과

  • MSRA 데이터셋에서 제안된 방법은 평균 3D 오차 7.2mm를 기록하여 이전 최신 기술 수준의 모든 방법을 능가한다.
  • NYU 데이터셋에서 방법은 평균 3D 오차 10.2mm를 기록하여 이전 최신 기술 수준 결과보다 뚜렷이 향상되었다.
  • ICVL 데이터셋에서 방법은 평균 3D 오차 7.3mm를 기록하여 Chen 등 [5]의 거의 포화 상태 성능을 재현하면서도 다른 방법들을 능가했다.
  • MSRA에서 81% 이상의 프레임이 관절 오차 20mm 이내에 있으며, 이는 이전 최신 기술 수준 방법이 달성한 60%보다 뚜렷한 향상이다.
  • 어려운 자세에 대해서도 높은 성공률를 기록하였으며, MSRA에서 91%의 프레임이 오차 30mm 이내에 머물렀고, 이는 이전 최고 방법의 81%보다 높은 성능이다.
  • 정성적 결과는 다양한 손 자세와 자가 음영 상황에서도 일관된 성능을 보였으며, 극단적인 경우를 제외하고는 미세한 실패 외에는 거의 실패가 없었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.