Skip to main content
QUICK REVIEW

[논문 리뷰] Towards large-scale, automated, accurate detection of CCTV camera objects using computer vision. Applications and implications for privacy, safety, and cybersecurity. (Preprint)

Hannu Turtiainen, Andrei Costin|arXiv (Cornell University)|2020. 06. 06.
Video Surveillance and Tracking Methods참고 문헌 81인용 수 6
한 줄 요약

이 논문은 이미지 및 영상 프레임에서 정확하고 자동으로 CCTV 카메라를 탐지할 수 있는 첫 번째 MS COCO 호환 컴퓨터 비전 모델인 CCTVCV를 소개한다. 수작업으로 레이블링된 8,387장의 이미지(10,419개의 카메라 인스턴스 포함)로 훈련된 최고의 모델은 98.7%의 정확도를 기록하여, 개인정보 보호 기반 내비게이션, 안전 경로 안내 및 사이버보안 응용 분야에서 대규모 카메라 위치 맵핑을 가능하게 한다.

ABSTRACT

In order to withstand the ever-increasing invasion of privacy by CCTV cameras and technologies, on par CCTV-aware solutions must exist that provide privacy, safety, and cybersecurity features. We argue that a first important step towards such CCTV-aware solutions must be a mapping system (e.g., Google Maps, OpenStreetMap) that provides both privacy and safety routing and navigation options. However, this in turn requires that the mapping system contains updated information on CCTV cameras' exact geo-location, coverage area, and possibly other meta-data (e.g., resolution, facial recognition features, operator). Such information is however missing from current mapping systems, and there are several ways to fix this. One solution is to perform CCTV camera detection on geo-location tagged images, e.g., street view imagery on various platforms, user images publicly posted in image sharing platforms such as Flickr. Unfortunately, to the best of our knowledge, there are no computer vision models for CCTV camera object detection as well as no mapping system that supports privacy and safety routing options. To close these gaps, with this paper we introduce CCTVCV -- the first and only computer vision MS COCO-compatible models that are able to accurately detect CCTV and video surveillance cameras in images and video frames. To this end, our best detectors were built using 8387 images that were manually reviewed and annotated to contain 10419 CCTV camera instances, and achieve an accuracy of up to 98.7%. Moreover, we build and evaluate multiple models, present a comprehensive comparison of their performance, and outline core challenges associated with such research.

연구 동기 및 목표

  • 시각 데이터에서 CCTV 카메라를 자동으로, 정확하고 확장 가능한 방법으로 탐지할 수 있는 방법의 부족을 해결하기 위해.
  • 사용자 인지 기반 경로 안내 및 내비게이션을 위해 정밀한 지리적 위치 및 메타데이터를 제공함으로써 개인정보 보호 기반 기술을 구현하기 위해.
  • 자동 탐지 및 맵핑을 통해 취약하거나 노출된 카메라를 식별함으로써 사이버보안 노력에 기여하기 위해.
  • 사용자가 공공 감시 환경에서 자신의 가시성을 제어할 수 있도록 하는 CCTV 인식 시스템의 기반을 마련하기 위해.
  • 재현 가능성과 향후 연구를 촉진하기 위해 오픈소스 데이터셋, 모델 및 도구를 공개하기 위해.

제안 방법

  • 최신 컴퓨터 비전 프레임워크(예: YOLO, RetinaNet)를 사용하여 MS COCO 호환 아키텍처를 갖춘 다수의 객체 탐지 모델을 개발하였다.
  • 모델 훈련 및 평가를 위해 8,387장의 이미지(10,419개의 별도 CCTV 카메라 인스턴스 포함)를 수집하고 수작업으로 레이블링하였다.
  • 정확도 향상과 일반화 능력 향상을 위해 사전 학습된 백본(예: ResNet, EfficientNet)을 활용한 전이 학습을 구현하였다.
  • 확장 가능한 데이터 수집 및 레이블링을 지원하기 위해 브라우저 기반의 이미지 레이블링 툴셋을 구현하였다.
  • CCTV 인식 경로 계획, 모바일 실시간 맵핑, 개인정보 보호 기반 내비게이션을 위한 기능성 프로토타입을 개발하고 평가하였다.
  • GitHub 및 FAIR 데이터 포털을 통해 훈련된 모델, 데이터셋, 코드 및 문서를 오픈 액세스 및 재사용 가능하게 공개하였다.

실험 결과

연구 질문

  • RQ1컴퓨터 비전 모델은 실제 이미지 및 영상 프레임에서 CCTV 카메라를 높은 정확도로 탐지할 수 있는가?
  • RQ2다양한 도시 환경에서 CCTV 카메라 탐지에 적용되었을 때, 다양한 객체 탐지 아키텍처의 성능은 어떠한가?
  • RQ3자동 CCTV 카메라 탐지 기술은 감시가 집중된 지역에서 개인정보 보호 기반 내비게이션과 실시간 사용자 인지 기능을 어떻게 지원할 수 있는가?
  • RQ4대규모, 정확하고 오픈된 데이터셋을 구축하기 위해 직면하는 주요 기술적 및 데이터 과제는 무엇인가?
  • RQ5자동 탐지 기술은 어떻게 취약하거나 노출된 감시 장치를 식별함으로써 사이버보안 노력에 기여할 수 있는가?

주요 결과

  • 최고의 성능을 보인 모델은 테스트 세트에서 평균 정밀도(mAP) 98.7%를 기록하여 CCTV 카메라 탐지에 높은 정확도를 입증하였다.
  • 8,387장의 레이블링된 이미지와 10,419개의 카메라 인스턴스를 포함한 이 데이터셋은 현재까지 공개된 바 있는 CCTV 카메라 탐지용 가장 큰 벤치마크이다.
  • 여러 최신 기술 기반 객체 탐지 프레임워크(예: YOLOv5, RetinaNet)가 성공적으로 미세조정 및 평가되었으며, YOLO 기반 모델이 뛰어난 성능을 보였다.
  • CCTV 인식 경로 계획 및 모바일 실시간 맵핑을 위한 기능성 프로토타입이 성공적으로 개발되고 시연되었다.
  • 브라우저 기반의 레이블링 툴셋을 통해 커뮤니티 기반 기여자들로부터 효율적이고 확장 가능한 데이터 수집이 가능했다.
  • 모델, 데이터셋, 코드 및 문서를 포함한 전체 연구 스택이 오픈소스 및 오픈데이터로 공개되어 재현 가능성과 커뮤니티 기반 확장이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.