Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Interacting Hand Pose Estimation by Hand De-occlusion and Removal

Hao Meng, Sheng Jin|arXiv (Cornell University)|2022. 07. 22.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 3D 상호작용 수동 자세 추정을 위한 새로운 손 탈옥 및 제거(HDR) 프레임워크를 제안하며, 작업을 별도의 손 탈옥, 방해가 되는 손 제거, 단일 손 자세 추정으로 분해한다. 이 방법은 새로운 대규모 합성 모달 손 데이터셋(Amodal InterHand, AIH)을 활용하여 InterHand2.6M에서 최신 기술 수준의 성능을 달성하며, 심각한 가림과 외관의 모호성 문제를 효과적으로 다루고 있다.

ABSTRACT

Estimating 3D interacting hand pose from a single RGB image is essential for understanding human actions. Unlike most previous works that directly predict the 3D poses of two interacting hands simultaneously, we propose to decompose the challenging interacting hand pose estimation task and estimate the pose of each hand separately. In this way, it is straightforward to take advantage of the latest research progress on the single-hand pose estimation system. However, hand pose estimation in interacting scenarios is very challenging, due to (1) severe hand-hand occlusion and (2) ambiguity caused by the homogeneous appearance of hands. To tackle these two challenges, we propose a novel Hand De-occlusion and Removal (HDR) framework to perform hand de-occlusion and distractor removal. We also propose the first large-scale synthetic amodal hand dataset, termed Amodal InterHand Dataset (AIH), to facilitate model training and promote the development of the related research. Experiments show that the proposed method significantly outperforms previous state-of-the-art interacting hand pose estimation approaches. Codes and data are available at https://github.com/MengHao666/HDR.

연구 동기 및 목표

  • 단일 RGB 이미지에서 3D 상호작용 수동 자세 추정 시 심각한 손-손 가림과 외관의 모호성 문제를 해결하기 위해.
  • 복잡한 상호작용 수동 작업을 더 단순한 하위 작업인 손 탈옥 및 제거, 다음으로 단일 손 자세 추정으로 분해하기 위해.
  • 훈련 및 벤치마킹을 지원하기 위해 모달 및 비모달 세그멘테이션, 탈옥, 제거 지도 데이터를 포함한 대규모 합성 데이터셋을 개발하기 위해.
  • 상호작용 수동 이미지를 단일 손 유사 입력으로 변환하여 최신 기술 수준의 단일 손 자세 추정기의 효과적 사용을 가능하게 하기 위해.

제안 방법

  • HDR 프레임워크는 세 가지 구성 요소로 이루어져 있다: 손 모달 세그멘테이션 모듈(HASM), 손 탈옥 및 제거 모듈(HDRM), 단일 손 자세 추정기(SHPE).
  • HASM은 양손에 대해 모달 및 가시 세그멘테이션 마스크를 생성하여 탈옥 및 제거에 필요한 공간적 및 외관적 단서를 제공한다.
  • HDRM은 이미지 수준의 탈옥을 수행하여 가려진 손 부분의 외관을 예측하고, 이미지 조작을 통해 방해가 되는 손을 제거한다.
  • 이 프레임워크는 이미지 복구 품질을 향상시키기 위해 디세크리미네이터를 사용한 적대적 훈련을 사용하며, 특징 상호작용과 수신 영역을 향상시키기 위해 트랜스포머 블록을 활용한다.
  • 두 가지 유형의 변형이 있는 새로운 대규모 합성 데이터셋인 Amodal InterHand (AIH)가 생성되었으며, AIH_Syn(복사-붙여넣기 방식으로 현실적인 외관)과 AIH_Render(3D 메시 렌더링을 통한 물리적으로 타당한 자세)이다.
  • 이 방법은 AIH에서 HDRM을 훈련시키고, 결과적으로 생성된 HDR 변환 이미지를 오프더쇼프 SHPE에 적용하여 최종 3D 자세 예측을 수행한다.

실험 결과

연구 질문

  • RQ1심각한 손-손 가림과 외관의 모호성 상황에서 HDR 프레임워크가 3D 상호작용 수동 자세 추정 성능 향상에 얼마나 효과적인가?
  • RQ2제안된 Amodal InterHand (AIH) 데이터셋은 기존 벤치마크와 비교해 모델의 일반화 능력과 성능 향상에 얼마나 기여하는가?
  • RQ3탈옥과 제거 중 어느 요소가 상호작용 수동 시나리오에서 자세 추정 오차 감소에 더 기여하는가?
  • RQ4트랜스포머 블록과 디세크리미네이터와 같은 설계 선택 사항이 HDR 프레임워크의 최종 성능에 어떤 영향을 미치는가?
  • RQ5HDR 프레임워크는 훈련 분포를 초월한 실제 세계 데이터셋에도 일반화 가능한가?

주요 결과

  • 제안된 HDR 프레임워크는 InterHand2.6M 벤치마크에서 18.10 mm MPJPE를 달성하여 이전 최신 기술 수준의 방법들을 뛰어넘었다.
  • 제거 기능을 비활성화할 경우 MPJPE가 34.4% 증가하여, 방해가 되는 손의 간섭을 줄이는 데 있어 이 기능의 핵심적인 역할을 확인했다.
  • 탈옥 기능을 비활성화할 경우 MPJPE가 9.5% 증가하여, 가려진 부분을 복구하는 것이 정확한 자세 추정에 필수적임을 확인했다.
  • 기본 모델 대비 트랜스포머 블록을 사용할 경우 성능이 4.8% 향상되어, 특징 학습에서의 중요성을 입증했다.
  • AIH_Render만으로 훈련해도 18.10 mm MPJPE를 달성하여, 물리적으로 타당한 합성 데이터가 일반화에 매우 효과적임을 보여주었다.
  • HDRM 모듈의 시간 비용은 프레임당 단지 0.6 ms이며, 이는 작업의 복잡성에도 불구하고 전체 추론이 효율적임을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.