Skip to main content
QUICK REVIEW

[논문 리뷰] Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose Estimation

Shreyas Hampali, Sayan Sarkar|arXiv (Cornell University)|2021. 04. 29.
Hand Gesture Recognition Systems인용 수 9
한 줄 요약

이 논문은 CNN 특징과 자기주의 주의 메커니즘을 사용하여 관절 식별과 관절 위치를 분리함으로써 3D 손 및 물체 자세 추정을 위한 새로운 방법인 Keypoint Transformer를 제안한다. 이는 기존 방법의 절반 수준의 파rameter를 사용하면서도 InterHand2.6M 및 HO-3D에서 최신 기술 수준의 성능을 달성하며, 75,000장의 완전히 3D 애너테이션된 3D 손-물체 상호작용 이미지를 포함하는 새로운 대규모 H2O-3D 데이터셋을 도입한다.

ABSTRACT

We propose a robust and accurate method for estimating the 3D poses of two hands in close interaction from a single color image. This is a very challenging problem, as large occlusions and many confusions between the joints may happen. State-of-the-art methods solve this problem by regressing a heatmap for each joint, which requires solving two problems simultaneously: localizing the joints and recognizing them. In this work, we propose to separate these tasks by relying on a CNN to first localize joints as 2D keypoints, and on self-attention between the CNN features at these keypoints to associate them with the corresponding hand joint. The resulting architecture, which we call "Keypoint Transformer", is highly efficient as it achieves state-of-the-art performance with roughly half the number of model parameters on the InterHand2.6M dataset. We also show it can be easily extended to estimate the 3D pose of an object manipulated by one or two hands with high performance. Moreover, we created a new dataset of more than 75,000 images of two hands manipulating an object fully annotated in 3D and will make it publicly available.

연구 동기 및 목표

  • 심한 가림과 외관의 모호성이 있는 두 손의 상호작용에서 정확한 3D 자세 추정 문제를 해결하기 위해.
  • 핫스팟 기반의 관절 회귀의 한계를 피하기 위해 관절 위치 추정과 관절 식별을 분리하기 위해.
  • 주의 메커니즘을 활용한 경량이지만 고정밀도의 3D 손 및 물체 자세 추정 아키텍처를 개발하기 위해.
  • 기준으로 사용하기 위한 새로운 대규모, 완전히 3D 애너테이션된 두 손 상호작용 데이터셋을 제작하고 공개하기 위해.

제안 방법

  • 먼저, 관절 식별을 부여하지 않고 2D 관절 위치를 예측하는 단일 CNN 기반의 히트맵을 생성한다.
  • 그런 다음, 관절 특징 간의 관계를 모델링하여 각 관절 위치를 관절 또는 배경으로 할당하는 자기주의 주의 메커니즘을 적용한다.
  • 크로스 주의 모듈이 각 3D 관절 쿼리에 대해 관련 있는 관절 위치를 선택함으로써 관절별 특징 집합을 가능하게 한다.
  • 이 아키텍처는 자세 표현 방식에 관계없이 작동하며, MANO 메쉬 및 관절 각도 형식을 포함한 다양한 파rameter화 방식을 지원한다.
  • 모델은 InterHand2.6M 및 HO-3D에서 훈련 및 평가되며, 광범위한 아블레이션 및 정성적 분석을 수행한다.
  • 새로운 H2O-3D 데이터셋은 17개의 다중 시야 시퀀스에서 유래한 75,000장의 이미지를 포함하며, 마커리스 옵티마이제이션 파이프라인을 통해 3D 애너테이션을 제공한다.

실험 결과

연구 질문

  • RQ1히트맵 기반의 회귀에 비해 트랜스포머 기반 접근이 심한 가림이 있는 두 손 상호작용에서 관절 식별 정확도를 향상시킬 수 있는가?
  • RQ2관절 위치 추정과 관절 식별을 분리함으로써 더 적은 파rameter로 더 높은 성능을 달성할 수 있는가?
  • RQ3손이 물체를 조작할 때 제안된 방법이 3D 물체 자세 추정으로 일반화될 수 있는가?
  • RQ4심한 가림이 있는 복잡한 실생활 손-물체 상호작용 시퀀스에서 모델의 성능은 어떠한가?
  • RQ5직접 히트맵 회귀에 비해 관절 특징 간의 자기주의 주의가 얼마나 더 강건한 성능을 제공하는가?

주요 결과

  • Keypoint Transformer는 이전 방법 대비 약 절반의 파rameter로 InterHand2.6M에서 최신 기술 수준의 성능을 달성한다.
  • HO-3D 데이터셋에서 모델은 3D 관절 오차 16.7 mm를 기록하며, 이는 이전 최신 기술 수준의 방법을 초월한다.
  • H2O-3D 데이터셋에서 물체 자세 MSSD는 7.9 cm이며, 개별 물체 오차는 머그(6.5 cm)에서 가위(13.5 cm)까지 다양하다.
  • 주의 시각화 결과는 모델이 가시 관절에 대해 정확한 관절 특징을 주의를 기울이고, 가려진 관절에 대해서는 인근 특징을 주의를 기울이는 것을 확인할 수 있다.
  • 복잡한 상호작용에 대해 잘 일반화되지만, 극도로 심한 가림이나 상호 침범 상황에서는 때로는 실패한다.
  • 제공된 H2O-3D 데이터셋은 정확한 3D 애너테이션을 갖춘 총 60,998장의 훈련 이미지와 15,342장의 테스트 이미지를 포함하며, 향후 공개될 예정이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.