Skip to main content
QUICK REVIEW

[논문 리뷰] HandsFormer: Keypoint Transformer for Monocular 3D Pose Estimation ofHands and Object in Interaction

Shreyas Hampali, Sayan Sarkar|arXiv (Cornell University)|2021. 04. 29.
Human Pose and Action Recognition참고 문헌 55인용 수 12
한 줄 요약

HandsFormer는 단일 RGB 이미지에서 상호작용하는 3D 손과 물체 자세 추정을 위해 열매점 Transformer 모델을 제안한다. 히트맵 극값을 입력으로 사용하고, 자기주의 주의를 통해 관절 구성 구성을 해결한다. InterHand2.6M 및 HO-3D에서 기준 방법 대비 17% 향상된 성능을 달성하였으며, 손-물체 상호작용을 위한 새로운 완전 3D 레이블이 부여된 액션 시퀀스 데이터셋을 제공한다.

ABSTRACT

We propose a robust and accurate method for estimating the 3D poses of two hands in close interaction from a single color image. This is a very challenging problem, as large occlusions and many confusions between the joints may happen. Our method starts by extracting a set of potential 2D locations for the joints of both hands as extrema of a heatmap. We do not require that all locations correctly correspond to a joint, not that all the joints are detected. We use appearance and spatial encodings of these locations as input to a transformer, and leverage the attention mechanisms to sort out the correct configuration of the joints and output the 3D poses of both hands. Our approach thus allies the recognition power of a Transformer to the accuracy of heatmap-based methods. We also show it can be extended to estimate the 3D pose of an object manipulated by one or two hands. We evaluate our approach on the recent and challenging InterHand2.6M and HO-3D datasets. We obtain 17% improvement over the baseline. Moreover, we introduce the first dataset made of action sequences of two hands manipulating an object fully annotated in 3D and will make it publicly available.

연구 동기 및 목표

  • 오염 및 관절 모호성이 빈번하게 발생하는 단일 RGB 이미지에서 두 상호작용하는 손의 3D 자세 추정 과제를 해결한다.
  • 2D 관절 검출이 불완전하거나 노이즈가 있을 경우에도 주의 메커니즘을 활용해 정확한 3D 구성으로 추론할 수 있는 강건한 방법을 개발한다.
  • 손과 그들이 조작하는 물체의 3D 자세를 동시에 추정할 수 있도록 접근을 확장하여 상호작용 인식 자세 추정을 가능하게 한다.
  • 향후 연구를 지원하기 위해 두 손이 물체를 조작하는 액션 시퀀스에 대한 새로운 벤치마크 데이터셋(3D 레이블이 모두 부여됨)을 제공한다.

제안 방법

  • 모든 관절이 검출되거나 정확하게 국소화되어 있지 않아도, 히트맵 극값으로서 잠재적인 2D 관절 위치를 추출한다.
  • 학습 가능한 임bedding을 사용해 이러한 2D 관절 후보의 외관과 공간적 위치를 인코딩하여 Transformer의 입력 시퀀스를 구성한다.
  • 자기주의 주의를 활용한 Transformer 아키텍처를 도입하여 오버랩되거나 가림을 겪는 관절 간의 장거리 의존성과 모호성을 해결한다.
  • 학습된 주의 특징에서 직접적으로 3D 관절 좌표를 회귀 예측함으로써 자세와 구성의 동시 최적화를 가능하게 한다.
  • 입력 시퀀스에 물체 전용 토큰을 추가하고, 그들의 3D 좌표를 예측함으로써 프레임워크를 확장하여 물체 관절 예측을 포함한다.
  • 손과 물체 자세 추정을 동시에 최적화하기 위해 3D 관절 좌표에 대한 표준 회귀 손실을 사용해 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1오염 및 노이즈가 있는 2D 검출이 존재하는 상황에서도, Transformer 기반 접근이 단일 이미지에서 두 상호작용하는 손의 모호한 3D 구성 구성을 효과적으로 해결할 수 있는가?
  • RQ2단일 모델이 두 손과 그들이 조작하는 물체의 3D 자세를 동시에 추정하는 데 얼마나 잘 성능을 내는가?
  • RQ3InterHand2.6M 및 HO-3D와 같은 도전적인 벤치마크에서 제안된 방법이 기준 방법 대비 얼마나 정확도를 향상시키는가?
  • RQ4손과 물체가 동적 운동을 하는 복잡한 상호작용 시퀀스에 대해 모델이 일반화 가능한가?

주요 결과

  • HandsFormer는 InterHand2.6M 데이터셋에서 기준 방법 대비 3D 관절 오차가 17% 상대적으로 향상되었다.
  • 주목을 활용해 2D 관절 검출이 불완전하거나 모호한 경우에도 정확한 3D 구성으로 추론할 수 있는 강력한 내성성을 보였다.
  • 물체 조작 시나리오에 대해 효과적으로 일반화되어 손과 조작 중인 물체의 정확한 3D 자세 추정이 가능했다.
  • 저자들은 두 손이 물체를 조작하는 액션 시퀀스에 대해 완전히 3D 레이블이 부여된 새로운 데이터셋을 공개하여 향후 상호작용 기반 3D 손 및 물체 자세 추정 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.