Skip to main content
QUICK REVIEW

[논문 리뷰] ReMotENet: Efficient Relevant Motion Event Detection for Large-scale Home Surveillance Videos

Ruichi Yu, Hongcheng Wang|arXiv (Cornell University)|2018. 01. 06.
Video Surveillance and Tracking Methods참고 문헌 3인용 수 3
한 줄 요약

ReMotENet는 공간-시간 주의력과 프레임 간 차분을 통합한 종단간 3D 컨볼루션 네트워크를 제안하여 가정 감시 영상에서 관련 운동 이벤트(예: 사람, 차량)를 탐지한다. 이는 단일 순방향 전파로 15초 영상 클립을 처리하여 기존의 이중 단계 방법 대비 최대 20,000배 빠른 속도 향상과 함께 정확도를 유지하거나 향상시키며, GPU에서는 4–8ms, CPU에서는 0.4초 이내의 추론 시간을 기록한다. 전체 모델 크기는 1MB 미만이다.

ABSTRACT

This paper addresses the problem of detecting relevant motion caused by objects of interest (e.g., person and vehicles) in large scale home surveillance videos. The traditional method usually consists of two separate steps, i.e., detecting moving objects with background subtraction running on the camera, and filtering out nuisance motion events (e.g., trees, cloud, shadow, rain/snow, flag) with deep learning based object detection and tracking running on cloud. The method is extremely slow and therefore not cost effective, and does not fully leverage the spatial-temporal redundancies with a pre-trained off-the-shelf object detector. To dramatically speedup relevant motion event detection and improve its performance, we propose a novel network for relevant motion event detection, ReMotENet, which is a unified, end-to-end data-driven method using spatial-temporal attention-based 3D ConvNets to jointly model the appearance and motion of objects-of-interest in a video. ReMotENet parses an entire video clip in one forward pass of a neural network to achieve significant speedup. Meanwhile, it exploits the properties of home surveillance videos, e.g., relevant motion is sparse both spatially and temporally, and enhances 3D ConvNets with a spatial-temporal attention model and reference-frame subtraction to encourage the network to focus on the relevant moving objects. Experiments demonstrate that our method can achieve comparable or event better performance than the object detection based method but with three to four orders of magnitude speedup (up to 20k times) on GPU devices. Our network is efficient, compact and light-weight. It can detect relevant motion on a 15s surveillance video clip within 4-8 milliseconds on a GPU and a fraction of second (0.17-0.39) on a CPU with a model size of less than 1MB.

연구 동기 및 목표

  • 대규모 가정 감시 시스템에서 기존의 이중 단계 운동 탐지 파이프라인의 비효율성과 높은 지연을 해결하기 위해.
  • 순차적인 배경 추출과 클라우드 기반 객체 탐지 대신 통합형 경량 신경망으로 대체하여 계산 비용을 줄이고 확장성을 향상시키기 위해.
  • 감시 영상에서의 공간-시간 중복성을 활용하여 관심 객체의 외관과 운동 패턴을 함께 모델링하기 위해.
  • 최소한의 모델 크기(<1MB)와 CPU 및 GPU에서의 낮은 추론 지연을 확보하여 실시간 엣지 기반 탐지 구현을 가능하게 하기 위해.
  • 비용이 많이 드는 수동 애너테이션을 피하기 위해 객체 탐지 결과에서 유도된 가짜 정답(가짜 지도)을 사용한 약한 지도 학습 전략을 개발하기 위해.

제안 방법

  • ReMotENet는 공간-시간 주의력(Spatial-Temporal Attention, STA)을 갖춘 3D 컨볼루션 네트워크를 사용하여 영상 클립 내에서 외관과 운동을 동시에 모델링하며, 관련 이동 객체에 집중한다.
  • 정적 배경을 억제하고 이동하는 전경을 강조하기 위해 국소 기준 프레임(RefL)을 사용한 프레임 간 차분을 적용하여 입력 복잡도를 감소시킨다.
  • 기존 방법의 프레임 단위 처리 병목 현상을 제거하기 위해 전체 15초 영상 클립을 단일 순방향 전파로 처리한다.
  • 가짜 정답 생성 파이프라인은 10FPS에서 작동하는 Faster R-CNN을 사용하며, 신뢰도 임계값이 0.8 이상인 경우를 기준으로 학습을 위한 이진 마스크를 생성한다.
  • 공간 주의 메커니즘은 5×3 격자 풀링을 사용하여 가짜 레이블을 특징 맵에 정렬함으로써 주의 모듈의 약한 지도 학습을 가능하게 한다.
  • 전체 모델을 객체 탐지 결과에서 유도된 약한 지도를 통해 엔드 투 엔드로 학습함으로써 완전한 애너테이션 비용을 피한다.

실험 결과

연구 질문

  • RQ1통합형 종단간 딥 러닝 모델이 가정 감시 영상에서 기존의 이중 단계 운동 탐지 파이프라인보다 속도와 정확도 면에서 뛰어나게 성능을 낼 수 있는가?
  • RQ2국소 기준 프레임(RefL)을 사용한 프레임 간 차분이 전역 기준 또는 원본 프레임 대비 운동 탐지 성능 향상에 얼마나 효과적인가?
  • RQ3공간-시간 주의력이 관련 이동 객체에 집중하면서도 계산 부담을 줄이는 데 얼마나 기여하는가?
  • RQ4객체 탐지에서 유도된 가짜 정답을 사용한 약한 지도 학습이 완전 지도 학습 방법과 비슷한 성능을 달성할 수 있는가?
  • RQ5실시간 엣지 장치에 배포 가능한 작고 효율적인 네트워크의 추론 지연과 모델 크기는 얼마인가?

주요 결과

  • ReMotENet는 이중 단계 객체 탐지 기준선과 비교해 유사하거나 뛰어난 평균 정밀도를 기록하였으며, RefL-C3D 입력을 사용할 경우 사람 운동에 대해 82.3% mAP, 차량 운동에 대해 73.0% mAP를 달성했다.
  • GPU에서는 15초 클립에 대해 4–8ms, CPU에서는 0.17–0.39초의 추론 시간으로 단축하여 기존 방법 대비 최대 20,000배(3–4개의 지수 차수) 빠른 속도 향상을 이룩했다.
  • 국소 기준 프레임 간 차분(RefL)을 사용할 경우 전역 기준 대비 4.5% 향상, 원본 프레임 대비 5.5% 향상되어 배경 억제에서의 효과를 입증했다.
  • 단 몇백 개의 학습 반복만으로도 좋은 수렴을 보이며 안정적이고 효율적인 학습 동역학을 보였다.
  • 최종 모델는 매우 작아서 1MB 미만이며, 자원이 제한된 엣지 장치에 배포하기에 적합하다.
  • 객체 탐지에서 유도된 가짜 정답이 주의 모듈의 성능 향상에 크게 기여하여 약한 지도 학습 전략의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.