Skip to main content
QUICK REVIEW

[논문 리뷰] A Foreground Inference Network for Video Surveillance Using Multi-View Receptive Field

Thangarajah Akilan|arXiv (Cornell University)|2018. 01. 19.
Video Surveillance and Tracking Methods참고 문헌 44인용 수 4
한 줄 요약

이 논문은 다중 시야 수용장역 완전 컨volution 신경망(MV-FCN)을 제안하여 영상 감시의 전경 분할을 수행한다. 이는 인셉션 모듈과 잔차 연결을 통해 다양한 수용장역 크기를 활용하여 다중 척도 특징 학습과 공간 정밀도를 향상시킨다. 정합된 프레임에서 엔드 투 엔드로 훈련된 모델은 평균 0.445초(2.25 FPS)의 추론 시간을 기록하며 11개의 벤치마크 데이터셋에서 기존 방법들을 능가하는 최신 기술 수준(SOTA)의 성능을 달성한다. 복잡한 후처리에 대한 의존도도 감소시켰다.

ABSTRACT

Foreground (FG) pixel labelling plays a vital role in video surveillance. Recent engineering solutions have attempted to exploit the efficacy of deep learning (DL) models initially targeted for image classification to deal with FG pixel labelling. One major drawback of such strategy is the lacking delineation of visual objects when training samples are limited. To grapple with this issue, we introduce a multi-view receptive field fully convolutional neural network (MV-FCN) that harness recent seminal ideas, such as, fully convolutional structure, inception modules, and residual networking. Therefrom, we implement a system in an encoder-decoder fashion that subsumes a core and two complementary feature flow paths. The model exploits inception modules at early and late stages with three different sizes of receptive fields to capture invariance at various scales. The features learned in the encoding phase are fused with appropriate feature maps in the decoding phase through residual connections for achieving enhanced spatial representation. These multi-view receptive fields and residual feature connections are expected to yield highly generalized features for an accurate pixel-wise FG region identification. It is, then, trained with database specific exemplary segmentations to predict desired FG objects. The comparative experimental results on eleven benchmark datasets validate that the proposed model achieves very competitive performance with the prior- and state-of-the-art algorithms. We also report that how well a transfer learning approach can be useful to enhance the performance of our proposed MV-FCN.

연구 동기 및 목표

  • 다양한 조명 조건과 동적인 배경에서 영상 감시 환경에서 정확한 전경 픽셀 수준의 레이블링 문제를 해결하기 위해.
  • 수동적 특징 엔지니어링, 복잡한 배경 모델링, 반복적인 후처리에 의존하는 전통적 방법의 한계를 극복하기 위해.
  • 다중 척도 및 다중 경로 특징 학습을 통한 딥러닝을 활용하여 일반화 능력과 공간 정밀도를 향상시키기 위해.
  • 제한된 훈련 데이터에서 성능 향상을 이끄는 전이 학습의 효과를 입증하기 위해.
  • 최적의 공간 표현을 위해 풀 풀링 및 완전 연결 층을 제거한 완전 컨volution형, 엔드 투 엔드 학습 가능한 네트워크를 개발하기 위해.

제안 방법

  • MV-FCN는 핵심 경로와 두 개의 보완적 특징 흐름 경로를 갖는 인코더-디코더 아키텍처를 사용하여 다중 척도 특징을 캡처한다.
  • 초기 및 후기 단계에 인셉션 모듈을 적용하여 세 가지 다른 커널 크기(예: 1×1, 3×3, 5×5)를 활용해 다중 척도 인식을 모의한다.
  • 잔차 연결을 통해 인코딩된 특징과 디코딩된 특징 맵을 융합하여 공간 세부 정보를 유지하고 기울기 흐름을 향상시킨다.
  • 모든 컨볼루션형 네트워크로서 최적 풀링 및 완전 연결 층을 제거하여 전체적으로 공간 해상도를 유지한다.
  • 지상 진실 전경-배경 분할 결과를 감독으로 사용하여 엔드 투 엔드로 훈련되며, 픽셀 수준의 분류가 가능하다.
  • 전이 학습을 적용하여 ImageNet으로 사전 훈련된 가중치로 네트워크를 초기화함으로써 제한된 데이터셋에서 수렴성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1다중 시야 수용장역을 갖춘 완전 컨볼루션 네트워크가 기존 딥러닝 모델 대비 전경 분할 정확도를 향상시킬 수 있는가?
  • RQ2인셉션 모듈과 잔차 연결의 통합이 전경 검출에서 다중 척도 특징 표현을 어떻게 향상시키는가?
  • RQ3전이 학습이 제한된 훈련 샘플을 가진 데이터셋에서 MV-FCN의 성능을 얼마나 향상시키는가?
  • RQ4제안된 아키텍처는 반복적인 후처리나 복잡한 배경 모델링 없이도 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5MV-FCN의 추론 속도는 표준 하드웨어에서 실시간 가능성이 있는가?

주요 결과

  • MV-FCN는 11개의 벤치마크 영상 감시 데이터셋에서 경쟁적인 성능을 달성하며, 전경 분할 정확도에서 기존 최신 기술 수준(SOTA) 방법들을 능가하거나 동등하게 유지한다.
  • 인셉션 모듈를 통한 다중 척도 특징 학습 덕분에 조명 변화와 동적인 배경에 대해 뛰어난 강건성을 보인다.
  • 잔차 연결은 공간 정밀도를 크게 향상시켜 경계 아티팩트를 감소시키고 객체 경계의 명확한 구분을 가능하게 한다.
  • 표준 CPU에서 평균 프레임당 0.445초(2.25 FPS)의 추론 시간을 기록하여 실시간 적용 가능성은 실용적임을 시사한다.
  • 전이 학습은 특히 제한된 훈련 데이터를 가진 데이터셋에서 성능 향상에 크게 기여하며, 사전 훈련된 특징 초기화의 가치를 확인한다.
  • 복잡한 후처리나 반복적인 배경 모델링이 필요 없어지며, 이는 정확도를 유지하면서도 파이프라인을 단순화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.