[논문 리뷰] Relational Learning for Joint Head and Human Detection
이 논문은 Head-Body Relationship Discriminating Module (RDM)를 통해 머리와 몸 사이의 관계 학습을 활용하여 머리 검출에서의 오진 억제와 혼잡한 장면에서 억제된 인간 검출의 재활용을 목표로 하는 새로운 통합 헤드 및 인간 검출 프레임워크 JointDet을 제안한다. 새로운 고품질 데이터셋을 통해 CrowdHuman, CityPersons, Caltech-USA 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Head and human detection have been rapidly improved with the development of deep convolutional neural networks. However, these two tasks are often studied separately without considering their inherent correlation, leading to that 1) head detection is often trapped in more false positives, and 2) the performance of human detector frequently drops dramatically in crowd scenes. To handle these two issues, we present a novel joint head and human detection network, namely JointDet, which effectively detects head and human body simultaneously. Moreover, we design a head-body relationship discriminating module to perform relational learning between heads and human bodies, and leverage this learned relationship to regain the suppressed human detections and reduce head false positives. To verify the effectiveness of the proposed method, we annotate head bounding boxes of the CityPersons and Caltech-USA datasets, and conduct extensive experiments on the CrowdHuman, CityPersons and Caltech-USA datasets. As a consequence, the proposed JointDet detector achieves state-of-the-art performance on these three benchmarks. To facilitate further studies on the head and human detection problem, all new annotations, source codes and trained models will be public.
연구 동기 및 목표
- 손, 팔꿈치와 같은 특징으로 인해 머리 검출에서 높은 오진 비율이 발생하는 문제를 해결하기 위해.
- Non-Maximum Suppression (NMS)에 의해 많은 유효한 검출이 억제되는 혼잡한 장면에서 인간 검출 성능을 향상시키기 위해.
- 머리와 몸 간의 본질적인 관계를 활용하여 두 작업의 검출 정확도를 향상시키기 위해.
- 향후 연구를 지원하기 위해 고품질의 새로 애너테이션된 데이터셋을 제공하기 위해.
제안 방법
- JointDet는 단일 스케일, 단일 아スペ크 레이티오 앵커를 사용하는 Region Proposal Network (RPN)을 활용해 효율적으로 머리 제안을 생성한다.
- 통계적 머리-몸 아スペ크 레이티오를 머리 제안에 적용하여 해당하는 전체 몸 제안을 생성함으로써 학습 및 추론 속도를 향상시킨다.
- 두 개의 병렬 R-CNN 브랜치가 머리 및 몸 제안을 처리하여 초보적 검출 결과를 도출한다.
- 머리 제안과 몸 제안이 같은 사람에 속하는지 그 특징을 기반으로 분류하기 위해 Head-Body Relationship Discriminating Module (RDM)을 도입한다.
- RDM의 출력을 후처리 전략에 활용하여 오진 머리 검출을 억제하고 NMS에 의해 제거된 인간 검출을 복구한다.
- 머리와 몸 간의 맥락적 관계를 활용하여 가림 및 혼잡한 상황에서도 검출의 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1머리와 인간 몸 간의 관계 학습이 두 작업의 검출 성능을 동시에 향상시킬 수 있는가?
- RQ2머리와 몸 간의 관계를 활용해 머리 검출에서의 오진을 줄일 수 있는가?
- RQ3혼잡한 장면에서 NMS에 의해 억제된 인간 검출을 머리 검출을 프록시로 사용해 효과적으로 복구할 수 있는가?
- RQ4고품질의 새로 애너테이션된 데이터셋을 사용하면 벤치마크 데이터셋에서 검출 성능이 크게 향상되는가?
주요 결과
- 제안된 JointDet는 CrowdHuman, CityPersons, Caltech-USA 데이터셋에서 기존 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.
- Caltech-USA 데이터셋에서 2.95%의 MR⁻² 점수를 기록하여 Reasonable 서브셋에서 모든 이전 최신 기술 수준의 방법들을 초월한다.
- 새로 재애너테이션된 Caltech-USA 데이터셋을 사용할 경우, FPN 기반 검출기의 MR⁻² 점수는 개선된 애너테이션을 사용할 때 4.31%에서 신규 애너테이션을 사용할 경우 3.26%로 감소하여 더 높은 애너테이션 품질을 시사한다.
- 신규 테스트 세트에서, 개선된 애너테이션을 사용할 경우 MR⁻² 점수는 16.52%에서 신규 애너테이션을 사용할 경우 14.26%로 감소하여 신규 데이터셋의 품질을 추가로 확인한다.
- RDM 기반 후처리 전략은 오진 머리 검출을 성공적으로 감소시키고, 혼잡한 장면에서의 질적 결과를 통해 많은 수의 억제된 인간 검출을 복구함을 보여준다.
- 신규 애너테이션은 Caltech-USA에 대해 훈련용 32,273개, 테스트용 1,123개의 지도값을 포함하며, 원본 개선된 버전(16,376 및 912개)보다 훨씬 더 많아 보다 강력한 평가 벤치마크를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.