Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Motion Modelling helps Semi-supervised Hand Pose Estimation

Adrian Spurr, Pavlo Molchanov|arXiv (Cornell University)|2021. 06. 10.
Human Pose and Action Recognition참고 문헌 57인용 수 8
한 줄 요약

이 논문은 레이블이 없는 영상 시퀀스를 활용하여 준감독 학습 환경에서 3D 손 자세 추정 성능을 향상시키는 적대적 운동 모델링 프레임워크를 제안한다. 실시간으로 일관되고 현실적인 손 운동 시퀀스를 생성하도록 훈련된 자세 예측기(포지션 예측기)가, 진짜와 생성된 운동 시퀀스를 구분하는 디스crimิน레이터에 의해 유도됨에 따라, 일반화 능력이 크게 향상되어 레이블이 적은 환경에서 평균 관절 오차가 40% 감소한다.

ABSTRACT

Hand pose estimation is difficult due to different environmental conditions, object- and self-occlusion as well as diversity in hand shape and appearance. Exhaustively covering this wide range of factors in fully annotated datasets has remained impractical, posing significant challenges for generalization of supervised methods. Embracing this challenge, we propose to combine ideas from adversarial training and motion modelling to tap into unlabeled videos. To this end we propose what to the best of our knowledge is the first motion model for hands and show that an adversarial formulation leads to better generalization properties of the hand pose estimator via semi-supervised training on unlabeled video sequences. In this setting, the pose predictor must produce a valid sequence of hand poses, as determined by a discriminative adversary. This adversary reasons both on the structural as well as temporal domain, effectively exploiting the spatio-temporal structure in the task. The main advantage of our approach is that we can make use of unpaired videos and joint sequence data both of which are much easier to attain than paired training data. We perform extensive evaluation, investigating essential components needed for the proposed framework and empirically demonstrate in two challenging settings that the proposed approach leads to significant improvements in pose estimation accuracy. In the lowest label setting, we attain an improvement of $40\%$ in absolute mean joint error.

연구 동기 및 목표

  • 고비용의 레이블링과 실제 환경에서의 낮은 일반화 능력으로 인해 3D 손 자세 데이터가 제한되는 문제를 해결한다.
  • 다양한 환경, 가림, 손의 다양성에 일반화하지 못하는 완전 감독 학습 방법의 한계를 극복한다.
  • 레이블이 없는 영상 데이터의 시공간적 구조를 활용하여, 쌍화된 레이블이 있는 시퀀스가 필요 없이 자세 추정 성능을 향상시킨다.
  • 기존의 전신 운동 모델과는 다름없이 손 자세에 특화된 새로운 운동 모델링 방법을 개발한다.
  • 완전히 레이블링된 데이터보다 더 쉽게 확보 가능한 비쌍화된 영상과 자세 시퀀스를 활용해 효과적인 준감독 학습을 가능하게 한다.

제안 방법

  • 레이블이 없는 영상에서 3D 손 자세 시퀀스를 생성하는 생성기(손 자세 추정기)를 활용한 새로운 적대적 운동 모델을 제안한다.
  • 실제 손 운동 시퀀스(레이블이 있는 데이터에서 유래)와 생성된 시퀀스(자세 추정기에서 유래)를 구분할 수 있도록 디스crimิน레이터를 훈련시켜 시간적 및 구조적 일관성을 강제한다.
  • 자세 예측기를 최적화하기 위해 최소-최대 적대적 훈련 목표를 사용하여, 생성된 예측이 실제 운동 시퀀스와 구분되지 않도록 한다.
  • 표준 프레임별 자세 추정 손실과 적대적 손실을 통합하여, 비쌍화된 영상에서의 엔드 투 엔드 훈련을 가능하게 하면서도 프레임 수준의 정확도를 유지한다.
  • 쌍화되지 않은 데이터를 사용할 수 있도록, 별도의 영상 시퀀스와 자세 시퀀스를 요구하지 않는 비쌍화된 운동 모델을 설계한다.
  • 특히 실제 환경에서의 일반화 능력과 강건성을 향상시키기 위해 2.5D 키포인트 표현 방식을 입력으로 사용한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 영상 시퀀스에서의 적대적 훈련이, 낮은 감독 환경에서 3D 손 자세 추정기의 일반화 능력을 향상시키는가?
  • RQ2기존의 전신 운동 모델과 비교했을 때, 손 자세에 특화된 운동 모델이 손 자세 추정에 있어 얼마나 효과적인가?
  • RQ3레이블이 없는 쌍화되지 않은 영상과 자세 시퀀스를 얼마나 효과적으로 활용하여, 진짜 레이블이 없이도 준감독 학습의 성능을 향상시킬 수 있는가?
  • RQ4적대적 운동 모델링을 통한 시간적 일관성 강제가, 표준 프레임 기반 기준 모델 대비 예측 오차를 줄이는가?
  • RQ5다양한 레이블링 비율과 도메인 외부 설정에서 제안된 방법은 어떻게 성능을 발휘하는가?

주요 결과

  • 가장 낮은 레이블 설정(10% 레이블 데이터)에서도 평균 관절 오차(MPJPE)가 40% 절대적으로 감소하여 강력한 일반화 성능 향상을 입증했다.
  • 10% 레이블 데이터 조건에서 FPHAB 프로토콜 2에서 27.60 mm MPJPE를 기록하여, 20% 레이블 데이터를 사용한 기준 모델(28.30 mm MPJPE)을 능가했다.
  • HO-3D 데이터셋에서 준감독 설정 하에 MPJPE가 24.5 mm로 감소하여, 이전 연구[22](31.8 mm)와 [51](30.4 mm)를 크게 앞서나갔다.
  • 절단 분석 결과, 적대적 운동 모델 자체만으로도 MPJPE가 4.95 mm 감소(28.47 mm → 23.52 mm)함을 확인하여 핵심 기여도를 입증했다.
  • 절대 오차와 루트 상대 오차 모두 향상되어 카메라 및 물체 자세 변화에 대한 강건성이 향상됨을 시사한다.
  • 2.5D 키포인트 표현 방식 사용으로 오차가 3.1 mm 감소했으며, 운동 모델 설계 선택으로 0.94 mm의 오차 감소를 기록하여 각 구성 요소의 효과를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.