Skip to main content
QUICK REVIEW

[논문 리뷰] Point in, Box out: Beyond Counting Persons in Crowds

Liu, Yuting, Mayue Shi|arXiv (Cornell University)|2019. 04. 02.
Video Surveillance and Tracking Methods참고 문헌 47인용 수 9
한 줄 요약

이 논문은 사람 검출과 군중 수세기의 동시에 수행을 위한 딥러닝 모델을 훈련하기 위해 오직 점수 수준의 애너테이션만을 활용하는 새로운 방법인 Point-Supervised Deep Detection Network(PSDDN)을 제안한다. 최근접 이웃 거리에서 머리 크기를 추출하고, 국소적으로 제약을 가한 회귀 손실과 커리큘럼 학습을 활용한 온라인 가짜 진짜값 업데이트를 통해, 상海Tech, UCF_CC_50, WiderFace, TRANCOS를 포함한 여러 벤치마크에서 검출 및 수세기 작업 모두에서 최신 기술(SOTA) 수준의 성능을 달성한다.

ABSTRACT

Modern crowd counting methods usually employ deep neural networks (DNN) to estimate crowd counts via density regression. Despite their significant improvements, the regression-based methods are incapable of providing the detection of individuals in crowds. The detection-based methods, on the other hand, have not been largely explored in recent trends of crowd counting due to the needs for expensive bounding box annotations. In this work, we instead propose a new deep detection network with only point supervision required. It can simultaneously detect the size and location of human heads and count them in crowds. We first mine useful person size information from point-level annotations and initialize the pseudo ground truth bounding boxes. An online updating scheme is introduced to refine the pseudo ground truth during training; while a locally-constrained regression loss is designed to provide additional constraints on the size of the predicted boxes in a local neighborhood. In the end, we propose a curriculum learning strategy to train the network from images of relatively accurate and easy pseudo ground truth first. Extensive experiments are conducted in both detection and counting tasks on several standard benchmarks, e.g. ShanghaiTech, UCF_CC_50, WiderFace, and TRANCOS datasets, and the results show the superiority of our method over the state-of-the-art.

연구 동기 및 목표

  • 회귀 기반 군중 수세기 방법의 한계를 해결한다. 이는 개인 식별이 불가능하다는 점이다.
  • 검출 기반 방법에서 요구하는 바운딩 박스 애너테이션의 높은 애너테이션 비용을 해결한다.
  • 사람의 머리에 대한 점 수준의 감독만으로도 검출 네트워크의 엔드 투 엔드 훈련을 가능하게 한다.
  • 비용이 많이 드는 바운딩 박스 애너테이션을 요구하지 않고도 밀도가 높은 군중에서의 국소화 정확도 및 크기 추정 정확도를 향상시킨다.
  • 다양한 데이터셋, 특히 사람 및 차량 수세기 작업에 대한 방법의 일반화 능력을 입증한다.

제안 방법

  • 최근접 이웃 머리 거리를 활용해 점 애너테이션에서 가짜 진짜값 바운딩 박스를 초기화한다.
  • 모델 예측 기반으로 훈련 중에 가짜 진짜값 바운딩 박스를 개선하기 위한 온라인 업데이트 기법을 구현한다.
  • 지역 범위 내에서 일관된 바운딩 박스 크기를 유도하는 국소적으로 제약을 가한 회귀 손실을 도입하여 시각적 왜곡 효과를 모델링한다.
  • 머리 거리 분포를 기반으로 더 정확하고 학습하기 쉬운 가짜 진짜값을 가진 이미지부터 우선적으로 훈련하는 커리큘럼 학습 전략을 설계한다.
  • 검출 헤드가 바운딩 박스를 예측하고 별도의 헤드가 군중 수를 추정하는 방식으로 점 수준의 감독만을 사용해 네트워크를 엔드 투 엔드로 훈련한다.
  • 지역 영역 내 크기 상관관계를 활용해 오직 점 애너테이션만으로도 타당한 바운딩 박스 치수를 유추한다.

실험 결과

연구 질문

  • RQ1오직 점 수준의 애너테이션만을 사용하여 사람 검출 및 군중 수세기의 딥 검출 네트워크를 효과적으로 훈련시킬 수 있는가?
  • RQ2수동적인 바운딩 박스 레이블링 없이 흩어진 머리 점 애너테이션에서 신뢰할 수 있는 가짜 진짜값 바운딩 박스를 어떻게 생성할 수 있는가?
  • RQ3지역 크기 일관성 제약 조건이 밀도가 높은 군중에서 검출 정확도 향상에 어느 정도 기여하는가?
  • RQ4다양한 군중 밀도를 다룰 때 커리큘럼 학습이 훈련의 안정성과 성능 향상에 기여하는가?
  • RQ5제안된 방법이 사람 수세기 외의 다른 검출 및 수세기 작업으로 일반화 가능한가?

주요 결과

  • PSDDN은 상해테크 및 UCF_CC_50 데이터셋에서 최신 기술(SOTA) 회귀 기반 방법과 경쟁 수준의 군중 수세기 성능을 달성한다.
  • 상해테크 데이터셋에서 PSDDN은 평균 절대 오차(MAE) 22.1과 평균 제곱 오차(MSE) 70.8을 기록하여 SOTA 회귀 방법과 유사한 성능을 보였다.
  • 사람 검출에서 PSDDN은 상해테크에서 AP 0.536을 달성하여 다른 점 수준 감독 방법을 뛰어넘고, 완전 감독 기반 검출기와도 유사한 성능을 보였다.
  • WiderFace 데이터셋에서 PSDDN은 쉬운, 중간, 어려운 세트에서 각각 AP 0.605, 0.605, 0.396을 기록하여 오직 점 수준의 감독에도 불구하고 강력한 일반화 능력을 입증했다.
  • TRANCOS 차량 수세기 데이터셋에서 PSDDN은 GAME0=4.79, GAME1=5.43, GAME2=6.68, GAME3=8.40을 기록하여 고차원 지표에서 최고의 회귀 기반 방법을 능가했다.
  • TRANCOS에서 검출 작업에 대해 PSDDN은 AP 0.669를 기록하여 더 낮은 감독 수준에서도 다른 도메인(차량 수세기)에서도 강력한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.