Skip to main content
QUICK REVIEW

[논문 리뷰] Attribute-aware Pedestrian Detection in a Crowd

Jialiang Zhang, Lixiang Lin|arXiv (Cornell University)|2019. 10. 21.
Video Surveillance and Tracking Methods참고 문헌 49인용 수 5
한 줄 요약

이 논문은 고밀도 시나리오에서의 검출 성능 향상을 위해 임베딩된 특징 맵을 통해 고수준의 의미적 속성(예: 밀도 및 다양성)을 모델링하는 속성 인식 보행자 검출기의 새로운 접근법을 제안한다. 속성 인식 비최대 억제(NMS)와 새로운 지도 타겟을 통합함으로써, CityPersons와 CrowdHuman에서 최신 기술을 크게 앞서는 성능을 기록하며, CityPersons(테스트 세트)에서 8.27%의 MR⁻², CrowdHuman에서 35.76%의 MR⁻²를 달성한다.

ABSTRACT

Pedestrian detection is an initial step to perform outdoor scene analysis, which plays an essential role in many real-world applications. Although having enjoyed the merits of deep learning frameworks from the generic object detectors, pedestrian detection is still a very challenging task due to heavy occlusion and highly crowded group. Generally, the conventional detectors are unable to differentiate individuals from each other effectively under such a dense environment. To tackle this critical problem, we propose an attribute-aware pedestrian detector to explicitly model people's semantic attributes in a high-level feature detection fashion. Besides the typical semantic features, center position, target's scale and offset, we introduce a pedestrian-oriented attribute feature to encode the high-level semantic differences among the crowd. Moreover, a novel attribute-feature-based Non-Maximum Suppression~(NMS) is proposed to distinguish the person from a highly overlapped group by adaptively rejecting the false-positive results in a very crowd settings. Furthermore, a novel ground truth target is designed to alleviate the difficulties caused by the attribute configuration and extremely class imbalance issues during training. Finally, we evaluate our proposed attribute-aware pedestrian detector on two benchmark datasets including CityPersons and CrowdHuman. The experimental results show that our approach outperforms state-of-the-art methods at a large margin on pedestrian detection.

연구 동기 및 목표

  • 심한 가림과 겹침으로 인해 개인을 구분하기 어려운 고밀도 시나리오에서 보행자 검출의 과제를 해결한다.
  • 고정 임계값 기반의 기존 NMS는 고밀도 군중에서 겹치는 후보 박스 처리에 어려움을 겪는 점을 극복한다.
  • 각 보행자에 대해 고수준 임베딩 벡터에 밀도 및 다양성과 같은 의미적 속성을 인코딩하여 특징 표현을 향상시킨다.
  • 고밀도 환경에서의 속성 구성으로 인한 클래스 불균형과 학습 불안정성 문제를 완화하기 위해 새로운 지도 타겟을 설계한다.
  • 의미적 임베딩을 활용해 가변적으로 오진을 억제하고 고밀도 군중에서 검출 결과를 개선하는 속성 인식 NMS를 개발한다.

제안 방법

  • 각 양성 인스턴스에 대해 밀도와 다양성 정보를 하나의 임베딩 벡터로 통합하여 인코딩하는 보행자 중심의 속성 맵을 도입한다.
  • 앵커리스 객체 검출 프레임워크를 확장하여, 각 검출된 보행자에 대해 3차원 임베딩 벡터를 예측하는 속성 헤드를 추가한다.
  • 속성 학습을 이끌고 클래스 불균형 문제를 해결하기 위해 밀도 레이블과 다양성 지표를 포함하는 새로운 지도 타겟을 설계한다.
  • 예측 박스의 임베딩 벡터 간의 의미적 거리를 사용해 겹치는 오진을 적응적으로 억제하는 속성 인식 NMS를 제안한다.
  • 분류, 회귀 및 속성 특화 손실을 포함하는 복합 손실 함수를 사용해 모델을 엔드 투 엔드로 훈련한다.
  • 다양한 보행자 크기와 가림 수준에서 검출 성능을 향상시키기 위해 다중 척도 특징 융합을 갖춘 DLA-34 백본을 사용한다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반 보행자 검출기에서 밀도 및 다양성과 같은 고수준 의미적 속성을 효과적으로 인코딩하는 방법은 무엇인가? 이는 고밀도 시나리오에서의 성능 향상에 어떻게 기여하는가?
  • RQ2서로 겹치거나 심한 가림을 겪는 다수의 보행자 존재 시, 기존의 탐욕적 NMS에 비해 속성 인식 NMS가 오진을 줄이는 데 얼마나 효과적인가?
  • RQ3제안된 지도 타겟 설계가 학습 중 속성 구성과 극심한 클래스 불균형 문제를 어느 정도 완화하는가?
  • RQ4밀도와 다양성 정보를 하나의 속성 맵에 통합하면 각 속성에 대해 별도의 브랜치를 사용하는 것보다 성능 향상이 더 크다고 볼 수 있는가?
  • RQ5표준 벤치마크에서 최신 기술 대비 정확도와 추론 속도 측면에서 속성 인식 검출기는 어떤 성능을 보이는가?

주요 결과

  • 제안된 방법은 CityPersons 테스트 세트에서 8.27%의 MR⁻² 성능을 기록하여, 최고의 경쟁자인 OR-CNN(11.32%)보다 3.05%p 높은 성능을 달성한다.
  • CrowdHuman 검증 세트에서 속성 인식 NMS를 사용한 결과 35.76%의 MR⁻² 성능을 기록했으며, 이를 사용하지 않은 기준선(36.79%)에 비해 뚜렷한 향상이 있었다.
  • 밀도와 다양성을 동시에 인코딩하는 속성 맵은 별도의 브랜치보다 0.4% 높은 성능을 보였으며, 이는 다중 작업 임베딩이 분리된 헤드보다 더 효과적임을 시사한다.
  • 모델은 1장당 0.16초의 속도로 실행되어 최근 최신 기술인 ALF(0.27초/장)와 CSP(0.33초/장)보다 빠르며, 이는 효율성 향상을 입증한다.
  • 제거 실험 결과, m=4일 때 임베딩 차원이 최적임을 확인했으며, m=3, 4, 8일 경우 유사한 성능를 기록해 임베딩 크기 변화에 대해 뛰어난 안정성을 보였다.
  • 다양한 설정에서 속성 인식 NMS는 탐욕적 NMS 대비 0.3–0.5%의 성능 향상을 보였으며, 겹치는 후보 박스 처리에 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.