Skip to main content
QUICK REVIEW

[논문 리뷰] SPCNet:Spatial Preserve and Content-aware Network for Human Pose Estimation

Yabo Xiao, Dongdong Yu|arXiv (Cornell University)|2020. 04. 13.
Human Pose and Action Recognition참고 문헌 27인용 수 7
한 줄 요약

SPCNet는 인간 자세 추정을 위한 새로운 공간 보존 및 콘텐츠 인식 네트워크를 제안하며, 넓은 수용장역을 확보하면서도 높은 공간 해상도를 유지하기 위해 확장된 아워글라스 모듈(Dilated Hourglass Module, DHM)과 다중 수준 특징을 공간 콘텐츠 인식 주의를 통해 적응적으로 융합하는 선택적 정보 모듈(Selective Information Module, SIM)을 도입한다. 이 방법은 MPII, LSP, FLIC 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, LSP에서 총 PCK 점수 96.4%와 FLIC에서 98.8%를 기록하였다.

ABSTRACT

Human pose estimation is a fundamental yet challenging task in computer vision. Although deep learning techniques have made great progress in this area, difficult scenarios (e.g., invisible keypoints, occlusions, complex multi-person scenarios, and abnormal poses) are still not well-handled. To alleviate these issues, we propose a novel Spatial Preserve and Content-aware Network(SPCNet), which includes two effective modules: Dilated Hourglass Module(DHM) and Selective Information Module(SIM). By using the Dilated Hourglass Module, we can preserve the spatial resolution along with large receptive field. Similar to Hourglass Network, we stack the DHMs to get the multi-stage and multi-scale information. Then, a Selective Information Module is designed to select relatively important features from different levels under a sufficient consideration of spatial content-aware mechanism and thus considerably improves the performance. Extensive experiments on MPII, LSP and FLIC human pose estimation benchmarks demonstrate the effectiveness of our network. In particular, we exceed previous methods and achieve the state-of-the-art performance on three aforementioned benchmark datasets.

연구 동기 및 목표

  • 장애물에 가려지거나 보이지 않거나 비정상적인 자세를 가진 관절의 위치를 정확히 추정하는 데 기여하기 위해 지속적인 과제를 해결하고자 한다.
  • 정확한 관절 위치 추정을 위해 높은 해상도의 공간 세부 정보를 유지하면서도 넓은 수용장역을 확보하고자 한다.
  • 다양한 단계와 스케일에서의 다중 수준 특징을 적응적으로, 콘텐츠 인식 기반으로 융합할 수 있도록 하기 위해 설계된다.
  • 혼잡한 장면, 겹치는 사지, 흐릿하거나 기형된 자세와 같은 복잡한 상황에서의 성능 향상을 위해 설계된다.

제안 방법

  • 확장된 아워글라스 모듈(DHG)은 표준 하향샘플링 대신 확장된 컨벌루션을 사용하여 공간 해상도를 유지하면서 수용장역을 확장한다.
  • DHM은 다중 스테이지로 스택되어 다중 스케일 및 다중 스테이지 특징을 캡처하며, 확장된 볼트넥을 통해 공간 세부 정보를 보존한다.
  • 선택적 정보 모듈(SIM)은 지역 콘텐츠에 민감한 주의 메커니즘을 사용하여 다중 수준의 특징을 픽셀 단위의 가중치 융합한다.
  • SIM의 주의 가중치는 공간 콘텐츠에 기반하여 계산되며, 지역 영역의 복잡성에 따라 동적으로 특징 선택이 가능하다.
  • 중간 지도 학습을 통해 엔드 투 엔드로 학습되며, 스택된 DHM과 SIM에 의한 적응적 융합을 통해 향상된 관절 히트맵 예측이 가능하다.
  • 아키텍처는 MPII, LSP, FLIC 벤치마크에서 평가되었으며, 모듈의 효과성을 확인하기 위한 분석 연구가 수행되었다.

실험 결과

연구 질문

  • RQ1특정 관절의 정확한 위치 추정을 위해 네트워크 아키텍처가 높은 공간 해상도를 유지하면서도 넓은 수용장역을 확보할 수 있는가?
  • RQ2다양한 단계와 스케일에서 유도된 다중 수준 특징을 어떻게 적응적으로 융합하여 어려운 자세에서의 성능을 향상시킬 수 있는가?
  • RQ3콘텐츠 인식 주의 메커니즘이 장애물에 가려진 경우나 비정상적인 자세에서 특징 선택을 향상시키는 데 기여하는가?
  • RQ4제안된 모듈이 MPII, LSP, FLIC와 같은 표준 벤치마크에서 기존 최신 기술 수준 방법을 초월할 수 있는가?

주요 결과

  • SPCNet는 LSP 테스트 세트에서 최신 기술 수준의 총 PCK 점수 96.4%를 달성하여 이전 방법들을 능가하였다.
  • LSP 데이터셋에서 SPCNet는 가장 가까운 경쟁자 대비 손목에서 4.4% 향상되고 팔꿈치에서 2.7% 향상된 PCK 성능을 기록하였다.
  • FLIC 데이터셋에서 SPCNet는 팔꿈치에 대해 PCK@0.2 99.3%와 손목에 대해 98.3%를 기록하였으며, 기준 아워글라스 네트워크보다 각각 0.3%와 1.2% 향상된 성능을 보였다.
  • qualitative 비교를 통해 SPCNet는 보이지 않는 사지, 장애물에 가려진 경우, 비정상적인 자세와 같은 어려운 케이스에서 예측 성능이 뚜렷이 향상됨을 확인하였다.
  • 분석 연구 결과, 확장된 아워글라스 모듈과 선택적 정보 모듈이 성능 향상에 상당한 기여를 했다.
  • 흐릿한 영역과 겹치는 사지가 있는 복잡한 상황에서도 네트워크는 더 높고 정확한 히트맵 반응을 보이며 뛰어난 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.