Skip to main content
QUICK REVIEW

[논문 리뷰] Pose2Seg: Detection Free Human Instance Segmentation

Song–Hai Zhang, Ruilong Li|arXiv (Cornell University)|2018. 03. 28.
Advanced Neural Network Applications참고 문헌 52인용 수 13
한 줄 요약

이 논문은 인간 포즈 스켈레톤을 경계 박스 대신 개체 분리에 사용하는 검출 기반이 아닌 인간 인스턴스 세분화 프레임워크인 Pose2Seg를 제안한다. 애핀-얼라인 모듈을 도입하고 스켈레톤 특징을 세분화 헤드에 명시적으로 융합함으로써, 특히 가림된 인스턴스에서 뛰어난 성능을 달성하여 OCHuman 및 COCOPerson 벤치마크에서 검출 기반 방법인 Mask R-CNN를 능가한다.

ABSTRACT

The standard approach to image instance segmentation is to perform the object detection first, and then segment the object from the detection bounding-box. More recently, deep learning methods like Mask R-CNN perform them jointly. However, little research takes into account the uniqueness of the "human" category, which can be well defined by the pose skeleton. Moreover, the human pose skeleton can be used to better distinguish instances with heavy occlusion than using bounding-boxes. In this paper, we present a brand new pose-based instance segmentation framework for humans which separates instances based on human pose, rather than proposal region detection. We demonstrate that our pose-based framework can achieve better accuracy than the state-of-art detection-based approach on the human instance segmentation problem, and can moreover better handle occlusion. Furthermore, there are few public datasets containing many heavily occluded humans along with comprehensive annotations, which makes this a challenging problem seldom noticed by researchers. Therefore, in this paper we introduce a new benchmark "Occluded Human (OCHuman)", which focuses on occluded humans with comprehensive annotations including bounding-box, human pose and instance masks. This dataset contains 8110 detailed annotated human instances within 4731 images. With an average 0.67 MaxIoU for each person, OCHuman is the most complex and challenging dataset related to human instance segmentation. Through this dataset, we want to emphasize occlusion as a challenging problem for researchers to study.

연구 동기 및 목표

  • 중요하게 가려진 인간 인스턴스를 다루는 데 있어 검출 기반 인스턴스 세분화의 한계를 해결한다.
  • 경계 박스보다 더 구분력 있는 신호로 인간 포즈 스켈레톤을 사용하여 인스턴스 분리에 활용한다.
  • 경계 박스 대신 포즈 키포인트를 사용하여 RoI를 자르고 정규화하는 새로운 정렬 메커니즘(Affine-Align)을 개발한다.
  • 가려진 인간 인스턴스에 대한 포괄적인 애너테이션을 포함한 새로운 벤치마크 데이터셋인 OCHuman을 제작하여, 가림을 핵심 과제로 강조한다.
  • 명시적인 스켈레톤 특징 융합이 가려진 상황에서 세분화 정확도와 강인성을 향상시킨다는 것을 입증한다.

제안 방법

  • 포즈 키포인트를 기반으로 스케일, 이동, 회전 및 좌우 반전 파rameter를 사용해 특징 맵을 정렬하는 가분성 있는 변환인 Affine-Align을 제안한다.
  • 검출 제안에 의존하지 않고 키포인트 좌표에서 RoI를 생성하는 포즈 기반 RoI 선택 전략을 설계한다.
  • 키포인트 위치와 가시성 정보를 2D 히트맵으로 인코딩하여 인공 스켈레톤 특징을 생성하고, 이는 애핀-얼라인 이후 특징 맵과 연결한다.
  • 전역적 맥락을 정확한 세분화에 활용하기 위해 약 50 픽셀의 수신장치를 가지는 SegModule을 사용한다(10개의 잔여 단위를 통해 구현함).
  • 비교 분석을 위해 학습 시 진짜 경계 박스와 키포인트를 사용하고, 다양한 정렬 및 특징 융합 전략 하에서 성능을 평가한다.
  • OCHuman 및 COCOPerson 데이터셋을 사용해 엔드 투 엔드로 프레임워크를 최적화하며, 인스턴스 세분화를 위해 교차 엔트로피 손실과 Dice 손실을 사용한다.

실험 결과

연구 질문

  • RQ1포즈 기반 인스턴스 세분화 프레임워크가 가려진 인간 인스턴스를 다루는 데 있어 검출 기반 방법보다 뛰어난 성능을 낼 수 있는가?
  • RQ2경계 박스 기반 방법과 비교해 인간 포즈 스켈레톤을 RoI 선택의 근거로 사용할 경우 인스턴스 분리 정확도가 향상되는가?
  • RQ3기본 RoI-Align과 비교해 제안된 Affine-Align 모듈이 복잡한 인간 자세와 가림 상황을 다룰 때 얼마나 효과적인가?
  • RQ4명시적으로 융합된 스켈레톤 특징이 특히 겹치거나 가려진 경우에 세분화 성능 향상에 얼마나 기여하는가?
  • RQ5가려진 인간에 중점을 둔 새로운 벤치마크가 실제 세계의 인간 인스턴스 세분화 과제를 더 잘 반영할 수 있는가?

주요 결과

  • 진짜 경계 박스와 키포인트를 사용할 때 Pose2Seg는 COCOPerson에서 0.582 AP를 달성하여 검출 기반 RoI-Align 기준(0.568 AP)을 능가한다.
  • 스켈레톤 특징 융합이 포함된 Affine-Align 전략은 OCHuman 검증 세트에서 0.544 AP를 기록하여 최고의 박스 기반 방법(0.497 AP)을 크게 앞서 간다.
  • 비교 분석 결과, Affine-Align과 스켈레톤 특징의 조합이 가장 높은 성능을 낸다. 이는 포즈 특징이 인스턴스 식별에 핵심적인 역할을 한다는 것을 시사한다.
  • 애핀 변환의 특성 덕분에 역전된 자세나 비정상적인 자세의 변형에도 강인하여, 다양한 자세 변화에 대응할 수 있다.
  • OCHuman 데이터셋은 4731장의 이미지에 걸쳐 총 8110개의 인간 인스턴스를 포함하고 있으며, 평균 MaxIoU는 0.67이며, 지금까지 가장 도전적인 가려진 인간 인스턴스 세분화 벤치마크로 평가된다.
  • 프레임워크의 성능은 NMS 제약이 아닌 포즈 추정 정확도에 의해 제한되며, 이는 검출 기반 접근 방식의 핵심적인 한계이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.