Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Disambiguate Strongly Interacting Hands via Probabilistic Per-pixel Part Segmentation

Zicong Fan, Adrian Spurr|arXiv (Cornell University)|2021. 07. 01.
Human Pose and Action Recognition인용 수 6
한 줄 요약

이 논문은 단일 단안 영상에서 상호작용하는 손의 3D 손 자세 추정을 위한 새로운 엔드 투 엔드 딥 러닝 방법인 DIGIT을 제안한다. 각 픽셀의 부위 분할 확률을 함께 예측하고 시각적 특징과 융합함으로써 자기 유사성으로 인한 모호성을 줄이며, InterHand2.6M 데이터셋에서 최신 기준 성능을 달성한다. 테스트 세트에서 MPJPE는 16.55mm이다.

ABSTRACT

In natural conversation and interaction, our hands often overlap or are in contact with each other. Due to the homogeneous appearance of hands, this makes estimating the 3D pose of interacting hands from images difficult. In this paper we demonstrate that self-similarity, and the resulting ambiguities in assigning pixel observations to the respective hands and their parts, is a major cause of the final 3D pose error. Motivated by this insight, we propose DIGIT, a novel method for estimating the 3D poses of two interacting hands from a single monocular image. The method consists of two interwoven branches that process the input imagery into a per-pixel semantic part segmentation mask and a visual feature volume. In contrast to prior work, we do not decouple the segmentation from the pose estimation stage, but rather leverage the per-pixel probabilities directly in the downstream pose estimation task. To do so, the part probabilities are merged with the visual features and processed via fully-convolutional layers. We experimentally show that the proposed approach achieves new state-of-the-art performance on the InterHand2.6M dataset. We provide detailed ablation studies to demonstrate the efficacy of our method and to provide insights into how the modelling of pixel ownership affects 3D hand pose estimation.

연구 동기 및 목표

  • 자기 유사성과 가림으로 인해 높은 모호성이 발생하는 상호작용하는 손의 3D 손 자세 추정 문제를 해결하기 위해.
  • 유사한 외관을 가진 두 손 간에 픽셀 소유권이 모호해지는 데 기인한 자세 추정 오차를 줄이기 위해.
  • 부위 분할을 확률적이고 엔드 투 엔드 미분 가능한 구성 요소로 명시적으로 모델링하여 시각적 특징과 통합함으로써 성능을 향상시키기 위해.
  • 이산 레이블이 아닌 각 픽셀의 분할 확률을 활용할 경우 자세 추정 정확도가 향상됨을 보여주기 위해.

제안 방법

  • 입력 영상을 동시에 각 픽셀의 의미적 부위 분할 마스크와 시각적 특징 볼륨으로 처리하는 이중 브랜치, 상호 연결된 네트워크 아키텍처를 사용한다.
  • 분할 브랜치는 각 픽셀에 대한 비정규화된 로짓(완전한 확률 분포)을 출력하여 후속 작업에 대한 불확실성을 유지한다.
  • 이러한 각 픽셀의 분할 확률은 시각적 특징과 연결되어 완전히 컨volutional 레이어를 통해 융합된 특징 표현을 생성한다.
  • 3D 자세 추정(MPJPE)과 부위 분할(교차 엔트로피)을 결합한 다중 작업 손실을 사용하여 엔드 투 엔드로 훈련하며, 공동 최적화를 가능하게 한다.
  • 관절 위치 예측을 정규화하고 기하학적 일관성을 향상시키기 위해 뼈 길이 손실을 통합한다.
  • 이전 방법들이 분할과 자세 추정을 분리한 것과 달리, DIGIT는 분할 확률을 직접 자세 추정 스트림에 통합하여 불확실성 인식 특징 융합을 가능하게 한다.

실험 결과

연구 질문

  • RQ1각 픽셀의 부위 분할 확률을 모델링하면 상호작용하는 손의 3D 손 자세 추정에 어떤 영향을 미치는가?
  • RQ2로짓을 통해 분할 불확실성을 통합할 경우 이산적 분할 레이블을 사용하는 것보다 자세 추정에서 얼마나 더 우수한 성능을 내는가?
  • RQ3분할과 자세 추정을 함께 엔드 투 엔드로 훈련하면 분리된 훈련보다 성능이 더 우수한가?
  • RQ4제안된 방법은 유사한 외관을 가진 손에서 발생하는 자기 유사성으로 인한 모호성을 어떻게 줄이는가?
  • RQ5분할 감독은 상대적 손 위치 추정(MRRPE)에 어떤 기여를 하는가?

주요 결과

  • DIGIT는 InterHand2.6M 데이터셋에서 테스트 세트 MPJPE가 16.55mm로 최신 기준 성능을 달성한다.
  • 제거 분석 결과, 분할 확률(SF)을 사용할 경우 검증 세트에서 기준 모델 대비 MPJPE가 1.38mm 감소하고, 테스트 세트에서는 0.99mm 감소한다.
  • 분할 손실(SL)만으로도 테스트 세트에서 MRRPE가 5.97mm 향상되어, 모호성이 감소함에 따라 상대적 손 위치 추정이 향상됨을 시사한다.
  • 이산 클래스 레이블 대신 로짓을 사용함으로써 분할 특징에서 성능 향상이 뚜렷하게 나타나, 불확실성 유지가 핵심임을 보여준다.
  • 기준 모델에 뼈 길이 손실이 있는 경우 대비 MRRPE가 5.97mm 향상되어 상대적 손 위치 추정이 향상됨을 입증한다.
  • 제거 분석을 통해 성능 향상은 추가 파rameter 때문이 아니라 분할 확률 통합 덕분임을 확인하였으며, 분할 감독이 없는 모델는 기준 모델과 유사한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.