Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Background Reconstruction and Foreground Segmentation via A Two-stage Convolutional Neural Network

Xu Zhao, Yingying Chen|arXiv (Cornell University)|2017. 07. 24.
Video Surveillance and Tracking Methods참고 문헌 3인용 수 8
한 줄 요약

이 논문은 비디오 시퀀스에서 배경 이미지를 동시에 재구성하고 전경 객체를 분할하는 양단계형 엔드 투 엔드 딥 컨volution 신경망을 제안한다. 배경 재구성을 위한 인코더-디코더 네트워크와 재구성된 배경 및 현재 프레임을 융합하는 다중채널 완전 컨volution 신경망(MCFCN)을 사용함으로써, 의미적 맥락과 운동 신호를 모두 활용하여 CDNet 2014에서 최신 기술 대비 4.9% 향상된 성능을 달성한다.

ABSTRACT

Foreground segmentation in video sequences is a classic topic in computer vision. Due to the lack of semantic and prior knowledge, it is difficult for existing methods to deal with sophisticated scenes well. Therefore, in this paper, we propose an end-to-end two-stage deep convolutional neural network (CNN) framework for foreground segmentation in video sequences. In the first stage, a convolutional encoder-decoder sub-network is employed to reconstruct the background images and encode rich prior knowledge of background scenes. In the second stage, the reconstructed background and current frame are input into a multi-channel fully-convolutional sub-network (MCFCN) for accurate foreground segmentation. In the two-stage CNN, the reconstruction loss and segmentation loss are jointly optimized. The background images and foreground objects are output simultaneously in an end-to-end way. Moreover, by incorporating the prior semantic knowledge of foreground and background in the pre-training process, our method could restrain the background noise and keep the integrity of foreground objects at the same time. Experiments on CDNet 2014 show that our method outperforms the state-of-the-art by 4.9%.

연구 동기 및 목표

  • 야간 조명, 그림자, 숨겨진 전경 객체 등 복잡한 환경에서 전통적인 비지도 학습 배경 모델링 방법의 한계를 해결한다.
  • 기존 방법의 수작업으로 조정된 파rameter에 의존하는 문제를 해결하기 위해 지도 학습 기반의 엔드 투 엔드 딥 러닝 프레임워크를 도입한다.
  • 다중 작업 학습을 통해 배경 재구성과 분할을 동시에 최적화하여 전경 분할 정확도를 향상시킨다.
  • 사전 훈련을 통해 의미적 사전 지식을 통합하여 배경 잡음에 대한 강건성과 전경의 무결성을 향상시킨다.

제안 방법

  • 훈련 프레임에서 장면 구조의 풍부한 사전 지식을 캡처하기 위해 깊이 있는 인코더-디코더 하위 네트워크를 사용하여 배경 이미지를 재구성한다.
  • 재구성된 배경 이미지를 기준으로 하여 현재 입력 프레임과 연결하여 분할 네트워크의 6채널 입력을 구성한다.
  • 연결된 입력을 처리하여 픽셀 단위의 전경 분할을 수행하는 다중채널 완전 컨볼루션 네트워크(MCFCN)를 구현한다.
  • 배경 이미지에 대한 L2 손실(재구성 손실)과 F-측정 기반 손실(분할 손실)을 조합한 다중 작업 손실을 사용하여 네트워크를 공동 최적화한다.
  • 라벨이 부여된 데이터로 네트워크를 사전 훈련하여 전경과 배경에 대한 의미적 지식을 통합함으로써 일반화 능력과 노이즈 강건성을 향상시킨다.
  • 공유 최적화를 통해 두 하위 네트워크를 엔드 투 엔드로 훈련시켜 배경 재구성과 전경 분할 간 상호 개선을 가능하게 한다.

실험 결과

연구 질문

  • RQ1배경 재구성과 전경 분할을 동시에 최적화하는 것이 별도의 모델링에 비해 복잡한 비디오 환경에서 성능 향상에 기여하는가?
  • RQ2재구성된 배경 이미지를 통해 운동 정보를 통합할 경우 전경 분할 정확도는 어느 정도 향상되는가?
  • RQ3의미적 지식을 활용한 사전 훈련은 그림자 및 저조도 조건과 같은 도전적인 상황에서 전경 분할의 강건성에 어떤 영향을 미치는가?
  • RQ4두 단계형 딥 러닝 프레임워크는 벤치마크 데이터셋에서 최신 비지도 배경 모델링 방법을 능가할 수 있는가?

주요 결과

  • 제안된 방법은 CDNet 2014 벤치마크에서 최신 기술 대비 F-측정 기준 4.9% 상대적 향상을 달성한다.
  • 공동 최적화가 적용된 두 단계 네트워크는 11개 카테고리 중 10개에서 베이스라인 FCN(Baseline-2)보다 우수한 성능을 보이며, 재구성된 배경을 입력으로 사용하는 것이 유의미한 이점을 제공함을 입증한다.
  • 야간 영상, 간헐적 객체 운동, 열화상 등 도전적인 카테고리에서는 다른 방법들에 비해 뚜렷한 성능 격차를 보이며, 일부 경우 F-측정이 0.96를 초과한다.
  • 그림자 영역에서의 오분류를 줄이고 더 정교한 전경 윤곽을 생성함을 시각적 비교를 통해 확인할 수 있다.
  • 공동 최적화 전략은 단일 두 단계 네트워크 대비 2.36% 향상시키며, 전체 공동 훈련을 통해 추가로 2.54% 향상되어 하위 네트워크 간 강력한 상호 보완 효과를 입증한다.
  • 재구성된 배경에 기반한 임계값 기반 분류를 사용한 베이스라인 방법은 F-측정이 0.6 이하에 머물러 있어, 딥 러닝 분류기의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.