Skip to main content
QUICK REVIEW

[논문 리뷰] RAPiD: Rotation-Aware People Detection in Overhead Fisheye Images

Zhihao Duan, M. Ozan Tezcan|ArXiv.org|2020. 05. 23.
Video Surveillance and Tracking Methods참고 문헌 32인용 수 4
한 줄 요약

RAPiD는 각도 예측을 위한 새로운 주기적 손실 함수를 사용하는 완전 컨volution 신경망을 활용해, 임의의 방향으로 기울여진 바운딩 박스를 회귀하는 종단간, 회전 인식 사람 검출 방법이다. 이는 표준 YOLO에 비해 추가적인 계산 비용 없이도 세 가지 데이터셋, 특히 새로운 과도한 도전 과제를 안고 있는 CEPDOF 데이터셋에서 최신 기술 수준을 초월한다.

ABSTRACT

Recent methods for people detection in overhead, fisheye images either use radially-aligned bounding boxes to represent people, assuming people always appear along image radius or require significant pre-/post-processing which radically increases computational complexity. In this work, we develop an end-to-end rotation-aware people detection method, named RAPiD, that detects people using arbitrarily-oriented bounding boxes. Our fully-convolutional neural network directly regresses the angle of each bounding box using a periodic loss function, which accounts for angle periodicities. We have also created a new dataset with spatio-temporal annotations of rotated bounding boxes, for people detection as well as other vision tasks in overhead fisheye videos. We show that our simple, yet effective method outperforms state-of-the-art results on three fisheye-image datasets. Code and dataset are available at http://vip.bu.edu/rapid .

연구 동기 및 목표

  • 반사 왜곡과 비수직인 인간 자세로 인해 표준 객체 검출 모델의 성능이 떨어지는 문제를 해결한다.
  • 회전된 사람을 처리하기 위해 반사 정렬 또는 복잡한 전처리/후처리에 의존하는 기존 방법의 한계를 극복한다.
  • 자세나 방향에 대한 가정 없이 임의의 방향으로 기울여진 바운딩 박스를 예측하는 종단간 딥 러닝 모델을 개발한다.
  • 오염, 모자, 저조도 조건과 같은 다양한 실제 시나리오를 포함한 새로운 과도한 도전 과제 데이터셋(CepDOF)을 제안하여 검출의 강인성 평가를 향상시킨다.
  • 스마트 빌딩에서 피시아이 카메라를 활용해 고정밀, 실시간 사람 검출을 가능하게 하여 점유율 감지 및 보안 응용에 기여한다.

제안 방법

  • 각 사람의 중심, 너비, 높이, 각도를 회귀함으로써 YOLOv3를 확장하여 기울어진 바운딩 박스를 예측한다.
  • 각도 공간의 순환 성질을 고려하기 위해 사인과余弦 표현을 사용하는 주기적 손실 함수를 도입하여 ±π에서의 불연속성을 방지한다.
  • [−π, π)의 유한한 각도 범위를 사용하고, 예측된 너비 < 높이를 강제하는 대칭 인식 헤드를 통해 유일한 박스 표현을 확보한다.
  • 이중 단계 추론이나 이전 방법에서처럼 이미지 회전을 피하기 위해 이미지당 단일 순방향 전파로 네트워크를 종단간으로 훈련시킨다.
  • 표준 이미지 사전 훈련 가중치보다 더 나은 성능을 내기 위해 피시아이 특화 데이터로 모델을 미세조정한다.
  • 단일 클래스 사람 검출을 위해 데이터 증강과 클래스 무관 헤드를 적용하여 추론 속도를 향상시키고 사람 전용 특징에 집중한다.

실험 결과

연구 질문

  • RQ1단일 단계, 종단간 딥 러닝 모델이 임의의 방향으로 기울여진 바운딩 박스를 사용해 수평 광각 이미지에서 사람을 효과적으로 검출할 수 있는가?
  • RQ2각도 회귀에 주기적 손실 함수를 사용할 경우, 표준 L1/L2 회귀에 비해 정확도와 각도 불연속성에 대한 강인성 측면에서 우수한 성능을 보일 수 있는가?
  • RQ3기존 방법과 비교해 복잡한 오염, 이국적인 자세, 저조도 조건과 같은 과도한 실제 시나리오에서 제안된 방법의 성능은 어떠한가?
  • RQ4표준 객체 검출 모델을 피시아이 데이터로 미세조정할 경우, 추론 복잡도를 증가시키지 않고 성능 향상이 어느 정도 이루어지는가?
  • RQ5공간-시간 애너테이션을 포함한 다양한 박스를 가진 새로운 데이터셋이 피시아이 환경에서 사람 검출의 평가 및 벤치마킹을 향상시킬 수 있는가?

주요 결과

  • RAPiD는 주기적 L1 손실을 사용해 HABBOF 데이터셋에서 88.9%의 AP50 성능을 달성하며, 다음으로 우수한 방법보다 1.9% 높은 성능을 기록했다.
  • CEPDOF 데이터셋에서 정상 조명 영상의 경우 1024×1024 해상도에서 AP50가 97.6%에 도달했으며, 고활동 및 점심 회의 시나리오에서는 F-메이저가 0.96를 초과했다.
  • 저조도 조건에서는 성능이 크게 떨어졌으며(예: All-off 영상에서 AP50 52.8%), 적외선 조명을 사용할 경우 65.6%로 향상되어 가시성에 민감함을 보였다.
  • 네트워크는 일관되게 너비 < 높이(평균 종횡비 >1)를 예측하여 대칭 가정의 타당성을 검증하고 고유한 박스 표현을 보장했다.
  • 주기적 손실 함수는 각도 예측 오차를 감소시키고, 비반사 및 비수직 자세의 정확한 검출을 가능하게 하였으며, 정성적 비교를 통해 이를 입증했다.
  • RAPiD는 표준 YOLO와 유사한 추론 속도를 유지했으며, 이는 이미지당 단일 순방향 전파만으로도 작동하여 이전 방법에서 요구하는 24배의 YOLO 적용을 피했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.