Skip to main content
QUICK REVIEW

[논문 리뷰] Rotation-invariant Mixed Graphical Model Network for 2D Hand Pose Estimation

Deying Kong, Haoyu Ma|arXiv (Cornell University)|2020. 02. 05.
Human Pose and Action Recognition참고 문헌 41인용 수 6
한 줄 요약

이 논문은 단일 RGB 영상에서 2D 손 자세 추정을 위한 새로운 딥러닝 아키텍처인 회전 불변 혼합 그래픽 모델 네트워크(R-MGMN)를 제안한다. 각기 다른 손 자세에 대해 회전 불변 네트워크와 학습 가능한 그래픽 모델 풀을 통합하고, 분류기로 인한 소프트 선택을 통해 관절 간의 일致성을 향상시키며, 최신 기술 수준의 성능을 달성한다. CMU Panoptic 데이터셋에서 CPM보다 4.76% mPCK 향상되었고, Large-scale 3D 데이터셋에서는 3.35% 향상되었다.

ABSTRACT

In this paper, we propose a new architecture named Rotation-invariant Mixed Graphical Model Network (R-MGMN) to solve the problem of 2D hand pose estimation from a monocular RGB image. By integrating a rotation net, the R-MGMN is invariant to rotations of the hand in the image. It also has a pool of graphical models, from which a combination of graphical models could be selected, conditioning on the input image. Belief propagation is performed on each graphical model separately, generating a set of marginal distributions, which are taken as the confidence maps of hand keypoint positions. Final confidence maps are obtained by aggregating these confidence maps together. We evaluate the R-MGMN on two public hand pose datasets. Experiment results show our model outperforms the state-of-the-art algorithm which is widely used in 2D hand pose estimation by a noticeable margin.

연구 동기 및 목표

  • 심한 자기 음영과 다양한 손 자세 방향에서 발생하는 기하학적 일致성 문제를 해결하기 위해.
  • 입력 이미지의 내용에 따라 적응하는 공간적 관계를 명시적으로 모델링함으로써 관절 위치 정확도를 향상시키기 위해.
  • 관절 예측 이전에 입력 이미지를 기준 자세로 회전시켜 자세 추정의 회전 불변성을 확보하기 위해.
  • 입력에 따라 유연하게 선택 가능한 그래픽 모델을 소프트 분류기를 통해 선택함으로써 모델의 능력과 적응성을 향상시키기 위해.
  • 회전, 단일 회귀, 다중 그래픽 모델을 통합한 통합 아키텍처의 종단 간 훈련을 달성하기 위해.

제안 방법

  • 공간 변환 네트워크를 영감으로 삼은 회전 네트워크가 손을 이미지 내 기준 자세로 정렬하기 위해 회전을 추정하고 적용한다.
  • 사전 정의된 그래픽 모델 풀에 대해 소프트 분류기가 확률 분포를 출력함으로써 입력 이미지의 내용에 따라 소프트 선택이 가능해진다.
  • 딥 컨volution 네트워크가 단일 열매맵을 추정하고, 각 그래픽 모델의 단일 잠재변수로 사용된다.
  • 신뢰도 전파가 각 그래픽 모델 별로 독립적으로 수행되어 근사 분포를 계산하고, 소프트 분류기의 가중치를 사용해 집계된다.
  • 최종 신뢰도 맵은 집계된 근사 분포를 원본 이미지 좌표계로 다시 회전시켜 얻는다.
  • 회전, 단일 회귀, 그래픽 모델 구성 요소의 별도 훈련 단계를 포함하는 다단계 최적화 스케줄을 통해 전체 네트워크를 종단 간 훈련한다.

실험 결과

연구 질문

  • RQ1입력 이미지를 기준 자세로 회전시킨 후 관절 예측을 수행함으로써, 회전 불변 네트워크가 2D 손 자세 추정 성능을 향상시킬 수 있는가?
  • RQ2입력 이미지에 따라 선택 가능한 다수의 그래픽 모델 풀을 사용할 경우, 고정된 단일 그래픽 모델에 비해 관절 일치성 향상이 이루어지는가?
  • RQ3학습된 분류기를 통한 그래픽 모델의 소프트 선택이 하드 선택 또는 고정 모델에 비해 성능 향상에 기여하는가?
  • RQ4회전 불변성과 다중 그래픽 모델의 혼합을 통합함으로써 표준 벤치마크에서 성능 향상이 유의미하게 발생하는가?
  • RQ5기존 방법이 실패하는 경우, 특히 손의 절반 이상이 자기 음영에 둘러싸인 상황에서도 제안된 아키텍처가 높은 정확도를 유지할 수 있는가?

주요 결과

  • CMU Panoptic 데이터셋에서 R-MGMN는 CPM 기준선 대비 평균 PCK(mPCK)에서 4.76% 향상되어 69.93% mPCK를 달성했다.
  • σ=0.03 기준으로 R-MGMN는 CPM 대비 PCK에서 6.22% 포인트 향상되어 관절 정확도 향상이 뚜렷하게 나타났다.
  • Large-scale 3D Multiview Hand Pose Dataset에서 R-MGMN는 CPM 대비 3.35% mPCK 향상되었고, σ=0.02 기준으로 PCK는 4.19% 향상되었다.
  • 제거 실험 결과, 단일 그래픽 모델 대비 혼합 그래픽 모델 도입으로 mPCK가 1.28% 향상되었으며, 회전 네트워크만 도입해도 성능이 3.35% 향상되었다.
  • 정성적 결과는 R-MGMN가 관절 간 기하학적 일치성을 크게 감소시키고, CPM이 실패하는 경우에도 인덱스 손가락과 엄지손가락과 같은 음영에 갇힌 손가락을 성공적으로 복원함을 확인했다.
  • 모델는 노이즈와 음영에 대해 강건성을 보였으며, 특히 손의 절반 이상이 자기 음영에 둘러싸인 어려운 케이스에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.