Skip to main content
QUICK REVIEW

[논문 리뷰] Background Subtraction with Real-time Semantic Segmentation

Dongdong Zeng, Xiang Chen|arXiv (Cornell University)|2018. 11. 25.
Video Surveillance and Tracking Methods참고 문헌 52인용 수 5
한 줄 요약

이 논문은 전통적인 배경 모델링과 실시간 의미 분할을 결합하여 정확도를 향상시킨 실시간 배경 분리 프레임워크(RTSS)를 제안한다. 병렬로 작동하는 배경 분할기와 의미 분할기의 출력을 융합함으로써 RTSS는 CDnet 2014에서 비지도 학습 방법 중 최고 성능을 기록하면서도 실시간 처리(38 ms/프레임)를 유지하며, 일부 지도 학습 딥 러닝 방법을 뛰어넘는 성능을 보였다.

ABSTRACT

Accurate and fast foreground object extraction is very important for object tracking and recognition in video surveillance. Although many background subtraction (BGS) methods have been proposed in the recent past, it is still regarded as a tough problem due to the variety of challenging situations that occur in real-world scenarios. In this paper, we explore this problem from a new perspective and propose a novel background subtraction framework with real-time semantic segmentation (RTSS). Our proposed framework consists of two components, a traditional BGS segmenter $\mathcal{B}$ and a real-time semantic segmenter $\mathcal{S}$. The BGS segmenter $\mathcal{B}$ aims to construct background models and segments foreground objects. The real-time semantic segmenter $\mathcal{S}$ is used to refine the foreground segmentation outputs as feedbacks for improving the model updating accuracy. $\mathcal{B}$ and $\mathcal{S}$ work in parallel on two threads. For each input frame $I_t$, the BGS segmenter $\mathcal{B}$ computes a preliminary foreground/background (FG/BG) mask $B_t$. At the same time, the real-time semantic segmenter $\mathcal{S}$ extracts the object-level semantics ${S}_t$. Then, some specific rules are applied on ${B}_t$ and ${S}_t$ to generate the final detection ${D}_t$. Finally, the refined FG/BG mask ${D}_t$ is fed back to update the background model. Comprehensive experiments evaluated on the CDnet 2014 dataset demonstrate that our proposed method achieves state-of-the-art performance among all unsupervised background subtraction methods while operating at real-time, and even performs better than some deep learning based supervised algorithms. In addition, our proposed framework is very flexible and has the potential for generalization.

연구 동기 및 목표

  • 복잡한 영상 감시 환경에서 정확하고 실시간으로 전경 객체를 검출하는 데 지속적으로 도전하는 문제를 해결하기 위해.
  • 일조 변화, 동적인 배경, 그림자 등에 민감한 전통적인 배경 분리 방법의 한계를 극복하기 위해.
  • 실시간 의미 분할을 피드백 메커니즘으로 통합하여 배경 모델 업데이트를 정밀화하고 분할 정확도를 향상시키기 위해.
  • 미래의 배경 모델링 및 의미 분할 기술 향상에 대응할 수 있도록 유연하고 모듈러한 프레임워크를 개발하기 위해.

제안 방법

  • 프레임워크는 두 개의 병렬 구성 요소를 사용한다: 초기 전경/배경 마스크 생성을 위한 배경 분할기(B)와 각 픽셀의 의미 레이블을 제공하는 실시간 의미 분할기(S).
  • 각 프레임에서 B는 일차적인 전경/배경 마스크(B_t)를 생성하고, S는 각 픽셀의 의미 레이블(S_t)을 추출한다.
  • 규칙 기반 융합 전략을 통해 B_t와 S_t를 융합하여 정밀화된 전경 검출 마스크(D_t)를 생성하며, 이 마스크는 이후 배경 모델 업데이트에 사용된다.
  • 의미 분할기는 피드백 메커니즘으로 기능하여 가짜 양성 결과를 필터링하고 모델 드리프트를 감소시켜 정확도를 향상시킨다.
  • 다양한 BGS 알고리즘(e.g., SuBSENSE, GMM)과 의미 모델(e.g., ICNet, PSPNet)을 지원하여 모듈성과 적응성을 확보한다.
  • 실시간 성능을 위해 최적화되었으며, Titan Xp GPU에서 ICNet을 사용할 경우 약 38 ms/프레임, PSPNet을 사용할 경우 약 51 ms/프레임의 처리 시간을 기록한다.

실험 결과

연구 질문

  • RQ1실시간 의미 분할은 복잡한 영상 시나리오에서 비지도 학습 배경 분리의 정확도와 강건성을 향상시킬 수 있는가?
  • RQ2의미 정보는 전통적인 배경 모델링과 어떻게 효과적으로 융합되어 그림자, 동적인 배경, 일조 변화로 인한 가짜 양성 결과를 줄일 수 있는가?
  • RQ3BGS와 의미 분할을 융합한 하이브리드 프레임워크는 실시간 성능를 유지하면서 기존 최고 수준의 비지도 학습 방법을 뛰어넘을 수 있는가?
  • RQ4의미 피드백은 얼마나 효과적으로 배경 모델 유지 보수를 향상시키고 모델 드리프트를 감소시키는가?

주요 결과

  • RTSS는 CDnet 2014 벤치마크에서 모든 비지도 학습 배경 분리 방법 중 최고 성능을 기록하였으며, 많은 딥 러닝 기반 지도 학습 방법을 뛰어넘었다.
  • 움직이는 나무, 물결치는 물, 카메라 진동, 간헐적인 운동, 강한 그림자, 편향-기울임-줌 효과 등 도전적인 영상 순서에서도 뛰어난 강건성을 보였다.
  • ICNet을 사용할 경우 약 38 ms/프레임의 처리 시간을 기록하여 표준 GPU에서 실시간 성능을 확보하였다.
  • PSPNet을 사용할 경우 처리 시간은 약 51 ms/프레임(N=3)이었으며, 이는 다양한 분할 정확도와 속도의 상호 교환 가능성을 확인하는 데 기여했다.
  • 정성적 결과 분석에서, 브로드웨이 및 소파 영상 순서와 같이 노이즈 수준이 높고 복잡한 교란이 존재하는 경우에도 완전하고 정확한 전경 추출이 가능함을 확인하였다.
  • 프레임워크의 모듈러한 설계 덕분에 향후 더 빠르고 정확한 BGS 및 의미 분할 모델의 원활한 통합이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.