Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Boosting Network For 3D Pose Estimation

Jun Liu, Henghui Ding|arXiv (Cornell University)|2019. 01. 15.
Human Pose and Action Recognition참고 문헌 40인용 수 8
한 줄 요약

이 논문은 단일 RGB 이미지에서 3D 손 및 신체 자세 추정을 위한 기능 부스팅 네트워크(FBN)를 제안한다. 이 네트워크는 신체 부위 간 장기 및 단기 의존성을 모델링하기 위해 그래픽스 컨볼루션 LSTM을 사용하는 장단기 의존성 인식(LSTD) 모듈을 포함한다. 또한 맥락 일관성 게이트(CCG)를 통해 맥락 일관성에 기반해 특징을 조절함으로써 특징을 보다 정교하게 다듬어, 3DHandPose, Human3.6M, MPI-INF-3DHP 데이터셋에서 최신 기준(SOTA) 성능을 달성한다.

ABSTRACT

In this paper, a feature boosting network is proposed for estimating 3D hand pose and 3D body pose from a single RGB image. In this method, the features learned by the convolutional layers are boosted with a new long short-term dependence-aware (LSTD) module, which enables the intermediate convolutional feature maps to perceive the graphical long short-term dependency among different hand (or body) parts using the designed Graphical ConvLSTM. Learning a set of features that are reliable and discriminatively representative of the pose of a hand (or body) part is difficult due to the ambiguities, texture and illumination variation, and self-occlusion in the real application of 3D pose estimation. To improve the reliability of the features for representing each body part and enhance the LSTD module, we further introduce a context consistency gate (CCG) in this paper, with which the convolutional feature maps are modulated according to their consistency with the context representations. We evaluate the proposed method on challenging benchmark datasets for 3D hand pose estimation and 3D full body pose estimation. Experimental results show the effectiveness of our method that achieves state-of-the-art performance on both of the tasks.

연구 동기 및 목표

  • 실제 환경 조건인 가림, 질감 변화, 조명 변화 등에서 단일 RGB 이미지로부터 정확한 3D 손 및 신체 자세를 추정하는 문제를 해결하기 위해.
  • 신체 부위 간 복잡한 장기 및 단기 의존성을 모델링하여 컨볼루션 네트워크의 특징 표현을 향상시키기 위해.
  • 특징의 맥락 표현과의 일관성에 기반해 특징을 조절하는 맥락 일관성 게이트(CCG)를 도입하여 특징 신뢰도를 향상시키기 위해.
  • 3D 손 및 전체 신체 자세 추정을 위한 벤치마크 데이터셋에서 최신 기준 성능을 달성하기 위해.

제안 방법

  • 제안된 기능 부스팅 네트워크는 중간 컨볼루션 특징 맵을 향상시키기 위해 CNN 아키텍처에 장단기 의존성 인식(LSTD) 모듈을 통합한다.
  • LSTD 모듈은 사전 정의된 그래픽스 구조를 통해 직접(단기) 및 간접(장기) 의존성을 신체 부위 특징 간에 모델링하기 위해 그래픽스 컨볼루션 LSTM을 사용한다.
  • 맥락 일관성 게이트(CCG)는 특징의 맥락과의 일관성 정도를 평가하고 특징 전파를 적절히 조절하는 소프트 모듈러레이터 역할을 한다.
  • 깊이 있는 아키텍처에서 다수의 컨볼루션 레이어와 LSTD 모듈을 스택하여 네트워크 전반에 걸쳐 다중 수준의 특징 부스팅을 가능하게 한다.
  • 모델은 벤치마크 데이터셋에서 표준 3D 자세 추정 손실 함수를 사용해 엔드 투 엔드로 훈련된다.
  • 그래픽스 의존성 구조는 해부학적 관절 연결 구조를 기반으로 설계되었으며, 제안된 아키텍처의 효과성을 검증하기 위해 분석 연구가 수행되었다.

실험 결과

연구 질문

  • RQ1신체 부위 간 장기 및 단기 의존성을 모델링하면 단일 RGB 이미지에서 3D 자세 추정 성능이 향상되는가?
  • RQ2맥락 인식 게이팅 메커니즘이 가림 및 질감 변화가 있는 환경에서 특징의 신뢰도를 향상시키는가?
  • RQ3그래픽스 컨볼루션 LSTM을 사용하는 제안된 LSTD 모듈이 기존의 순환 모듈인 ConvRNN 및 ConvGRU보다 3D 자세 추정에서 우수한 성능을 내는가?
  • RQ4이러한 특징 부스팅 네트워크는 다양한 데이터셋, 특히 교차 데이터셋 평가에서도 잘 일반화되는가?

주요 결과

  • 3DHandPose 데이터셋에서 제안된 방법은 PCK@20가 89.5%를 기록하여 기준 모델인 3D Pose Net을 초월했다.
  • Human3.6M에서 방법은 PCK@50가 51.5%를 기록하여 기준 모델인 3D Pose Net 대비 3.4% 향상되었다.
  • MPI-INF-3DHP에서의 교차 데이터셋 평가에서는 PCK가 69.6%를 기록하여 이전 방법들인 [42] (69.2%) 및 [20] (64.7%)를 뛰어넘었다.
  • CCG 모듈을 추가함으로써 Human3.6M에서 PCK@50 기준 1.7% 향상되었고, 3DHandPose에서는 2.3% 향상되었다.
  • Human3.6M에서 평균 오차는 61 mm를 기록하여 기준 3D Pose Net 대비 4 mm 감소하였다.
  • 분석 연구 결과, 의존성 그래프에 더 많은 연결을 추가해도 성능 향상이 없었으며, 이는 설계된 그래프 구조의 최적성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.