Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Multi-Person Pose Estimation and Semantic Part Segmentation

Fangting Xia, Peng Wang|arXiv (Cornell University)|2017. 08. 10.
Human Pose and Action Recognition참고 문헌 30인용 수 10
한 줄 요약

이 논문은 깊이 학습된 특징과 새로운 세그먼트-조인트 부드러움 항목을 갖춘 완전 연결 CRF를 사용하여 다수의 사람 자세 추정과 의미적 파트 분할을 위한 통합 프레임워크를 제안한다. 자세가 파트 분할을 안내하고, 파트가 자세를 정밀화하는 반복적 융합을 통해, 자세 추정에서 10.6% 향상되고, 분할에서 1.5% 향상되며, 검출된 인간 박스 기반의 인스턴스 수준 CRF 추론을 통해 이전 작업 대비 40배 빠른 속도로 실행된다.

ABSTRACT

Human pose estimation and semantic part segmentation are two complementary tasks in computer vision. In this paper, we propose to solve the two tasks jointly for natural multi-person images, in which the estimated pose provides object-level shape prior to regularize part segments while the part-level segments constrain the variation of pose locations. Specifically, we first train two fully convolutional neural networks (FCNs), namely Pose FCN and Part FCN, to provide initial estimation of pose joint potential and semantic part potential. Then, to refine pose joint location, the two types of potentials are fused with a fully-connected conditional random field (FCRF), where a novel segment-joint smoothness term is used to encourage semantic and spatial consistency between parts and joints. To refine part segments, the refined pose and the original part potential are integrated through a Part FCN, where the skeleton feature from pose serves as additional regularization cues for part segments. Finally, to reduce the complexity of the FCRF, we induce human detection boxes and infer the graph inside each box, making the inference forty times faster. Since there's no dataset that contains both part segments and pose labels, we extend the PASCAL VOC part dataset with human pose joints and perform extensive experiments to compare our method against several most recent strategies. We show that on this dataset our algorithm surpasses competing methods by a large margin in both tasks.

연구 동기 및 목표

  • 약한 외관 신호 하에서 모호성과 형태적 맥락의 부족으로 악영향을 받는 독립적인 자세 추정 및 파트 분할의 한계를 해결하기 위해.
  • 자세가 전역적 형태 사전 정보를 제공하고, 파트가 공간 일관성을 제공하므로, 자세와 파트 정보의 상호 보완성을 활용하기 위해.
  • 전체 이미지 CRF 추론의 계산 비용을 줄이기 위해 인간 검출 박스를 활용해 국소화된 효율적 추론을 수행하기 위해.
  • 공동 학습을 위한 14개의 인간 관절 레이블을 추가하여 PASCAL VOC Part를 확장하여 새로운 벤치마크 데이터셋을 구축하고 공개하기 위해.
  • 공동 최적화가 정확도와 추론 속도 면에서 기존 최고 수준의 성능을 초월하는 두 작업 모두에 긍정적인 영향을 미친다는 것을 입증하기 위해.

제안 방법

  • 자세 스코어 맵과 관절 이웃 맵을 위한 자세 FCN, 파트 스코어 맵을 위한 파트 FCN를 각각 풀 컨볼루션 네트워크로 훈련한다.
  • 새로운 세그먼트-조인트 부드러움 항목을 갖춘 완전 연결 CRF에 세 가지 유형의 특징(관절 스코어, 이웃 스코어, 파트 스코어)을 융합하여 공간적 및 의미적 일관성을 강제한다.
  • 개선된 자세 관절을 기반으로 스켈레톤 특징을 생성하고, 이를 두 번째 단계 파트 FCN에 추가 정규화 신호로 제공한다.
  • 자동 확대 전략을 적용: 검출기로 인간 인스턴스를 검출하고, 각 인스턴스를 크기 조정한 후, 각 경계 상자 내에서 CRF 추론을 수행하여 복잡도를 감소시킨다.
  • 훈련 및 평가를 위해 14개의 관절 레이블이 추가된 PASCAL-Person-Part 데이터셋을 활용한다.
  • 다단계 추론 파이프라인을 사용: 초기 FCN 예측 → CRF 개선 → 자세 특징을 포함한 두 번째 단계 FCN로 분할 정확도 향상.

실험 결과

연구 질문

  • RQ1독립 학습에 비해 자세 추정과 의미적 파트 분할을 공동 최적화함으로써 두 작업의 성능 향상이 가능한가?
  • RQ2특히 모호하거나 가림이 있는 경우, 파트 수준의 의미적 일관성을 효과적으로 자세 추정에 정규화로 활용할 수 있는가?
  • RQ3자세를 형태 사전 정보로 통합함으로써, 특히 저대비 또는 복잡한 영역(예: 팔다리)에서 의미적 파트 분할의 정확도와 세밀함이 향상되는가?
  • RQ4인간 검출 박스 내에서 CRF 추론을 국소화하면 정확도를 손상시키지 않고 계산 비용을 크게 감소시킬 수 있는가?
  • RQ5제안된 방법이 소규모 및 대규모 인간 인스턴스에 대해 얼마나 일반화되는가?

주요 결과

  • 제안된 방법은 경쟁 기법 대비 자세 추정 정확도를 10.6% 향상시키며, 소규모 또는 가려진 사람과 같은 어려운 케이스에서 뚜렷한 향상이 이루어진다.
  • 공동 추론 프레임워크는 자세 추정의 국소화 오류를 감소시키며, 잘못된 위치에 있는 팔꿈치와 손목을 수정하고, 누락된 이마 관절을 복구하는 데 기여한다.
  • mIOU 기준으로 의미적 파트 분할 정확도가 1.5% 향상되었으며, 특히 소규모 인스턴스에서 손상이 있는 경우에 더 뚜렷한 향상이 이루어진다.
  • ResNet-101을 사용하여 PASCAL-Person-Part 데이터셋에서 64.39%의 mIOU를 달성했으며, 소규모 인간 인스턴스에서 이전 최고 기술보다 5% 이상 뛰어난 성능을 기록했다.
  • 인스턴스 수준 CRF 추론을 사용함으로써 전체 이미지 CRF 대비 추론 시간을 40배 감소시켜, 이미지당 8초로 단축시켰으며, DeeperCut 대비 4분에서 8초로 개선되었다.
  • 시각적 결과는 특히 외관 신호가 약한 영역에서 자세와 파트 예측이 더 일관되고 세밀한 결과를 도출한다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.