Skip to main content
QUICK REVIEW

[논문 리뷰] PersonLab: Person Pose Estimation and Instance Segmentation with a Bottom-Up, Part-Based, Geometric Embedding Model

George Papandreou, Tyler Zhu|arXiv (Cornell University)|2018. 03. 22.
Human Pose and Action Recognition인용 수 6
한 줄 요약

PersonLab는 기하학적 임베딩을 사용하여 동시에 사람 자세 추정과 인스턴스 세그멘테이션을 수행하는 완전 컨볼루션형, 바닥에서부터 시작하는 접근법을 제안한다. 이는 관절 위치와 상대 이동량을 예측하고, 탐지된 관절을 탐욕적 디코딩을 통해 그룹화하며, 기하학적 임베딩 벡터를 사용해 픽셀을 사람 인스턴스에 할당한다. 단일 스케일 추론을 통해 COCO 관절 검출에서 SOTA인 AP 0.687과 사람 인스턴스 세그멘테이션에서 AP 0.417을 달성한다.

ABSTRACT

We present a box-free bottom-up approach for the tasks of pose estimation and instance segmentation of people in multi-person images using an efficient single-shot model. The proposed PersonLab model tackles both semantic-level reasoning and object-part associations using part-based modeling. Our model employs a convolutional network which learns to detect individual keypoints and predict their relative displacements, allowing us to group keypoints into person pose instances. Further, we propose a part-induced geometric embedding descriptor which allows us to associate semantic person pixels with their corresponding person instance, delivering instance-level person segmentations. Our system is based on a fully-convolutional architecture and allows for efficient inference, with runtime essentially independent of the number of people present in the scene. Trained on COCO data alone, our system achieves COCO test-dev keypoint average precision of 0.665 using single-scale inference and 0.687 using multi-scale inference, significantly outperforming all previous bottom-up pose estimation systems. We are also the first bottom-up method to report competitive results for the person class in the COCO instance segmentation task, achieving a person category average precision of 0.417.

연구 동기 및 목표

  • 제약 없는 환경에서 다수의 사람 자세 추정과 인스턴스 세그멘테이션을 위한 통합된, 박스 기반의 프레임워크를 개발한다.
  • 상대 이동량 예측을 통한 장거리 관절 관계 모델링을 통해 바닥에서부터 시작하는 자세 추정 정확도를 향상시킨다.
  • 장면 내 사람 수에 관계없이 런타임이 일정한 효율적이고 확장 가능한 추론을 가능하게 한다.
  • 부분 기반 기하학적 임베딩 표현을 통해 경쟁적인 인스턴스 세그멘테이션 성능을 달성한다.
  • 경량의 완전 컨볼루션형 아키텍처를 통해 모바일 장치에 실시간 배포를 지원한다.

제안 방법

  • 완전 컨볼루션 네트워크를 사용해 관절 히트맵과 관절 쌍 간의 상대 이동량 벡터를 예측한다.
  • 장거리 이동량 예측의 정확도를 향상시키기 위해 반복적 보정 모듈을 도입한다.
  • 가장 신뢰도가 높은 탐지 결과부터 시작해 탐지된 관절을 탐욕적 디코딩으로 사람 인스턴스로 그룹화한다.
  • 각 사람 픽셀에 대해, 해당 인스턴스의 K개의 모든 관절까지의 오프셋을 코딩한 조밀한 기하학적 임베딩 벡터를 예측한다.
  • 기하학적 임베딩 필드를 사용해 평균 관절 거리와 탐지 신뢰도를 기반으로 각 픽셀을 가장 가까운 사람 인스턴스에 할당한다.
  • COCO 관절 및 세그멘테이션 애너테이션을 기반으로 엔드 투 엔드로 훈련하며, 인스턴스 무관한 세그멘테이션 맵을 활용한다.

실험 결과

연구 질문

  • RQ1객체 검출기 의존 없이 바닥에서부터 시작하는 부분 기반 접근법이 다수의 사람 자세 추정에서 최고 성능을 달성할 수 있는가?
  • RQ2반복적 보정을 통한 상대 이동량 예측은 장거리 관절 그룹화 정확도 향상에 얼마나 효과적인가?
  • RQ3기하학적 임베딩 표현은 바닥에서부터 시작하는 프레임워크에서 정확하고 효율적인 인스턴스 수준의 세그멘테이션을 가능하게 하는가?
  • RQ4작은 사람 인스턴스의 관절을 보간함으로써 훈련 시 세그멘테이션 성능 향상이 이루어지지만, 관절 AP 평가에 영향을 주지 않음에도 불구하고 성능 향상이 이루어지는가?
  • RQ5완전 컨볼루션형, 단일 스포트 모델이 사람 수에 관계없이 높은 정확도를 달성하고 추론 시간이 일정한가?

주요 결과

  • PersonLab는 다중 스케일 추론을 사용해 COCO 테스트-디브에서 관절 평균 정밀도(AP) 0.687을 달성하며, 이는 이전의 바닥에서부터 시작하는 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 이 모델은 COCO 사람 카테고리에서 바닥에서부터 시작하는 인스턴스 세그멘테이션의 새로운 SOTA를 수립했으며, AP 0.417을 달성하여 강력한 상향식 FCIS 기준 모델인 0.386을 초월했다.
  • 오프셋 보정은 관절 AP를 3.3% 향상시키고 세그멘테이션 AP를 2.2% 향상시켰으며, 큰 인스턴스의 경우 각각 5.4%와 9.1%의 향상률을 기록했다.
  • 작은 사람 인스턴스의 관절을 보간함으로써 세그멘테이션 AP는 4.4% 향상되었으며, 작은 물체의 경우 AP는 134% 상승(7.6%에서 16.4%로)했다.
  • 단일 스케일 추론을 통해 높은 성능을 달성했으며, 사람 수에 관계없이 계산 시간이 일정하여 빠른 추론 속도를 유지했다.
  • 시스템은 단순하고 효율적이며, 두 번째 단계의 보정 또는 클러스터링을 피함으로써 모바일 장치에 적합한 배포가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.