Skip to main content
QUICK REVIEW

[논문 리뷰] CrowdPose: Efficient Crowded Scenes Pose Estimation and A New Benchmark

Jiefeng Li, Can Wang|arXiv (Cornell University)|2018. 12. 02.
Human Pose and Action Recognition참고 문헌 28인용 수 41
한 줄 요약

본 논문은 joint-candidate SPPE와 글로벌 최대 관절 연결(global maximum joints association)을 도입하여 혼잡한 장면에서 다인 포즈 추정성을 향상시키고 CrowdPose 데이터셋을 제시한다; CrowdPose에서 5.2 mAP 향상을 달성하고 MSCOCO로 일반화한다.

ABSTRACT

Multi-person pose estimation is fundamental to many computer vision tasks and has made significant progress in recent years. However, few previous methods explored the problem of pose estimation in crowded scenes while it remains challenging and inevitable in many scenarios. Moreover, current benchmarks cannot provide an appropriate evaluation for such cases. In this paper, we propose a novel and efficient method to tackle the problem of pose estimation in the crowd and a new dataset to better evaluate algorithms. Our model consists of two key components: joint-candidate single person pose estimation (SPPE) and global maximum joints association. With multi-peak prediction for each joint and global association using graph model, our method is robust to inevitable interference in crowded scenes and very efficient in inference. The proposed method surpasses the state-of-the-art methods on CrowdPose dataset by 5.2 mAP and results on MSCOCO dataset demonstrate the generalization ability of our method. Source code and dataset will be made publicly available.

연구 동기 및 목표

  • 혼잡한 장면에서 차폐 및 중첩으로 성능이 저하되는 상황에서 포즈 추정의 개선 동기를 제시한다.
  • 전역 정보를 활용하여 모호한 관절을 해결하는 빠르고 강건한 방법을 개발한다.
  • 혼잡하지 않은 곳과 혼잡한 곳에서 성능 평가를 위한 균일한 군중 분포를 가진 데이터셋을 만든다.
  • 제안된 접근법의 MSCOCO 일반화 가능성을 보여주고 공개 코드 및 데이터 제공한다.

제안 방법

  • 사용 인간 제안과 단일 인물 포즈 추정을 이용한 2단계 상향식 파이프라인을 사용한다.
  • joint-candidate SPPE는 각 관절에 여러 개의 후보를 예측하고 목표 관절과 간섭 관절을 포함한다.
  • 인간 제안과 관절 후보를 연결하는 person-joint 그래프를 구축한다.
  • 그래프 매칭 형식을 사용한 글로벌 최대 관절 어소시에이션을 적용하고 Kuhn–Munkres 알고리즘으로 해결되는 K개의 이분매칭 하위 문제로 분해한다.
  • 계산 효율성을 확보하기 위하여 이 접근법의 난이도가 greedy NMS와 비교해도 어려움이 비슷하고 희소성을 활용한다는 것을 증명한다.

실험 결과

연구 질문

  • RQ1혼잡한 장면에서 포즈 추정이 근처 사람으로 인한 간섭에 얼마나 강건할 수 있을까?
  • RQ2joint-candidate, 다중 피크 접근이 정확도를 희생하지 않으면서 참된 관절의 재현율을 높일 수 있을까?
  • RQ3전역적 그래프 기반 어소시시에이션이 지역적 또는 탐욕적 방법보다 올바른 관절-사람 매칭을 개선할 수 있을까?
  • RQ4제안된 CrowdPose 데이터셋이 비혼잡 및 혼잡한 장면 전반의 평가를 얼마나 잘 지원하고 일반화를 촉진하는가?

주요 결과

  • 제안된 방법은 같은 백본으로 CrowdPose에서 5.2 mAP의 SOTA를 능가한다.
  • MSCOCO에서 SPPE와 후처리를 제안 모듈로 교체하면 +0.8 mAP를 달성한다.
  • 이 방법은 CrowdPose 테스트 세트에서 10.1 FPS를 달성하여 혼잡한 상황에서 정확도와 속도의 균형을 이룬다.
  • CrowdPose 데이터셋은 균일한 Crowd Index 분포와 MSCOCO, MPII, AI Challenger보다 평균 바운딩 박스 IoU가 더 높고(0.27) 다양한 평가를 지원한다.
  • joint-candidate 손실은 표준 손실을 사용할 때보다 mAP를 크게 향상시킨다(66.0%) 대 61.7%.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.