Skip to main content
QUICK REVIEW

[논문 리뷰] PS-RCNN: Detecting Secondary Human Instances in a Crowd via Primary Object Suppression

Zheng Ge, Zequn Jie|arXiv (Cornell University)|2020. 03. 16.
Video Surveillance and Tracking Methods참고 문헌 20인용 수 6
한 줄 요약

PS-RCNN는 밀도 높은 장면에서 사람을 더 잘 감지하기 위해 주요 R-CNN(P-RCNN)를 사용해 시야에 보이는 사람 인스턴스를 탐지하고, 사람 모양의 마스크를 통해 이를 억제함으로써 2차 R-CNN(S-RCNN)이 심하게 가림을 입은 사람을 탐지할 수 있도록 하는 이단계 객체 검출 프레임워크이다. 이 방법은 CrowdHuman에서 2.92% AP 향상과 4.49% 재현율 향상을 달성하였으며, WiderPerson에서도 유사한 성과를 기록하였다.

ABSTRACT

Detecting human bodies in highly crowded scenes is a challenging problem. Two main reasons result in such a problem: 1). weak visual cues of heavily occluded instances can hardly provide sufficient information for accurate detection; 2). heavily occluded instances are easier to be suppressed by Non-Maximum-Suppression (NMS). To address these two issues, we introduce a variant of two-stage detectors called PS-RCNN. PS-RCNN first detects slightly/none occluded objects by an R-CNN module (referred as P-RCNN), and then suppress the detected instances by human-shaped masks so that the features of heavily occluded instances can stand out. After that, PS-RCNN utilizes another R-CNN module specialized in heavily occluded human detection (referred as S-RCNN) to detect the rest missed objects by P-RCNN. Final results are the ensemble of the outputs from these two R-CNNs. Moreover, we introduce a High Resolution RoI Align (HRRA) module to retain as much of fine-grained features of visible parts of the heavily occluded humans as possible. Our PS-RCNN significantly improves recall and AP by 4.49% and 2.92% respectively on CrowdHuman, compared to the baseline. Similar improvements on Widerperson are also achieved by the PS-RCNN.

연구 동기 및 목표

  • 약한 시각적 신호와 NMS 억제로 인해 성능이 저하되는 혼잡한 장면에서 심하게 가림을 입은 사람 인스턴스를 탐지하는 문제를 해결한다.
  • 특징 억제와 IoU 기반 NMS로 인해 표준 검출기가 가림을 입은 사람을 탐지하지 못하는 한계를 극복한다.
  • 거짓 경고 수를 증가시키지 않으면서도 2차(심하게 가림을 입은) 사람 인스턴스의 탐지 재현율과 AP를 향상시킨다.
  • 주요(시야에 보이는) 및 보조(가림을 입은) 사람 인스턴스의 탐지를 분리하여 전문화된 학습이 가능한 이중 브랜치 R-CNN 아키텍처를 설계한다.
  • COCOPerson에서의 고품질 인스턴스 마스크와 함께 고해상도 RoI 정렬(HRRA) 모듈을 사용해 가림을 입은 사람의 특징 표현을 향상시킨다.

제안 방법

  • 표준 Faster R-CNN 학습을 사용해 약간 또는 전혀 가림을 입지 않은 사람 인스턴스를 탐지하기 위해 주요 R-CNN(P-RCNN)을 사용한다.
  • P-RCNN 탐지 결과에서 사람 모양의 이진 마스크를 생성하여 특징 맵에서 이들의 특징을 억제함으로써 가림을 입은 사람의 특징이 드러나도록 한다.
  • 입력 이미지가 아닌 특징 맵에 억제 마스크를 적용하여 공간 해상도를 유지하고 추론 효율성을 향상시킨다.
  • 마스크 처리된 특징 맵을 기반으로 2차 R-CNN(S-RCNN)을 학습시켜 심하게 가림을 입은 사람 인스턴스를 탐지하며, 정확한 국소화를 위해 IoU ≥ 0.6인 경우를 양성 제안으로 정의한다.
  • 고해상도 RoI 정렬(HRRA)을 통합하여 최고 해상도 특징 레이어에서 세밀한 특징을 추출함으로써 시야에 보이는 신체 부위의 세부 정보를 유지한다.
  • COCOPerson에서의 미세 조정을 통해 마스크 품질을 향상시키고 S-RCNN의 성능을 강화한다.

실험 결과

연구 질문

  • RQ1시야에 보이는 사람과 가림을 입은 사람을 분리해 탐지하는 이단계 검출기의 성능 향상이 혼잡한 장면에서 재현율과 AP 향상에 기여하는가?
  • RQ2사람 모양의 마스크를 사용해 주요 사람 인스턴스를 억제하면 보조(심하게 가림을 입은) 인스턴스의 탐지 성능이 향상되는가?
  • RQ3고해상도 RoI 정렬(HRRA)을 사용하면 계산 비용 증가 없이도 가림을 입은 사람의 특징 표현을 향상시킬 수 있는가?
  • RQ4S-RCNN에서 양성 제안의 IoU 임계값 선택이 탐지 성능에 미치는 영향은 무엇인가?
  • RQ5제안된 PS-RCNN 프레임워크는 다양한 가림 패tern과 애너테이션 유형을 가진 WiderPerson과 같은 다른 데이터셋에 일반화 가능한가?

주요 결과

  • 기본 모델인 FPN를 갖춘 Faster R-CNN에 비해 PS-RCNN는 CrowdHuman 데이터셋에서 AP를 2.92% 향상시키고 재현율을 4.49% 향상시켰다.
  • WiderPerson에서 PS-RCNN는 기본 모델인 Faster R-CNN에 비해 1.63%의 AP 향상과 2.01%의 재현율 향상을 달성하였다.
  • HRRA와 COCOPerson에서의 미세 조정 조합은 CrowdHuman에서 AP를 2.41% 향상시켜 향상된 특징과 마스크 품질의 효과를 입증하였다.
  • 특징 맵에 사람 모양의 마스크를 적용하는 것이 입력 이미지에 적용하는 것과 유사한 성능을 내며, 시간 효율성이 더 뛰어나다.
  • S-RCNN는 높은 신뢰도 예측(점수 > 0.5)을 다수 생성하여, 이는 소프트-NMS와 같은 낮은 신뢰도 중복 예측에 의존하지 않는다는 것을 시사한다.
  • S-RCNN에서 양성 제안의 IoU 임계값으로 0.6을 사용할 경우 AP가 87.94로 가장 높게 나타나 0.5와 0.7보다 우수하여 국소화 정확도와 제안 품질 사이의 최적 균형을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.