Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Deep Context Prediction for Background Foreground Separation

M. Sultana, Arif Mahmood|arXiv (Cornell University)|2018. 05. 21.
Video Surveillance and Tracking Methods참고 문헌 38인용 수 3
한 줄 요약

이 논문은 배경 추정과 전경 분할을 위해 문맥 예측과 이미지 인painting을 활용한 비지도 학습 기반 GAN 기반 방법인 딥 컨텍스트 예측(Deep Context Prediction, DCP)을 제안한다. 밀도 있는 광학 흐름을 활용해 움직이는 물체를 탐지하고, 이를 제거하여 누락 영역을 생성한 후, 전역적 문맥과 국소적 텍스처 제약 조건을 사용해 누락된 이미지 내용을 예측하는 CNN 기반 인코더-디코더 네트워크를 훈련시킴으로써, DCP는 SBM.net 및 CDnet2014 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 악천후 및 열화상 영상과 같은 도전적인 조건에서도 뛰어난 성능을 보였다.

ABSTRACT

In many advanced video based applications background modeling is a pre-processing step to eliminate redundant data, for instance in tracking or video surveillance applications. Over the past years background subtraction is usually based on low level or hand-crafted features such as raw color components, gradients, or local binary patterns. The background subtraction algorithms performance suffer in the presence of various challenges such as dynamic backgrounds, photometric variations, camera jitters, and shadows. To handle these challenges for the purpose of accurate background modeling we propose a unified framework based on the algorithm of image inpainting. It is an unsupervised visual feature learning hybrid Generative Adversarial algorithm based on context prediction. We have also presented the solution of random region inpainting by the fusion of center region inpaiting and random region inpainting with the help of poisson blending technique. Furthermore we also evaluated foreground object detection with the fusion of our proposed method and morphological operations. The comparison of our proposed method with 12 state-of-the-art methods shows its stability in the application of background estimation and foreground detection.

연구 동기 및 목표

  • 수동으로 설계된 기능에 의존하는 전통적 배경 모델링 방법의 한계를 해결하고, 동적인 배경, 조명 변화, 카메라 진동 등의 상황에서 성능 저하를 방지하기 위해.
  • 감시 및 추적 응용 분야에서 흔히 발생하는 동적인 배경, 그림자, 사진적 변형과 같은 복잡한 상황에서의 성능 저하 문제를 해결하기 위해.
  • 정답 레이블이 필요한 학습 데이터 없이도 정확한 배경 초기화를 가능하게 하는 비지도 딥 러닝 프레임워크를 개발하기 위해.
  • 문맥 예측을 세분적 인painting 및 포isson 블렌딩과 통합하여 임의의 영역에 대한 인painting을 처리하고 텍스처의 현실감을 향상시키기 위해.
  • 악천후 및 열화상 영상과 같이 기존 방법이 실패하는 도전적인 영상 카테고리 포함 다양한 영상 유형에서 견고한 성능을 달성하기 위해.

제안 방법

  • 밀도 있는 광학 흐름을 사용해 시간적 운동 정보를 추출하고, 빠르게 움직이는 전경 물체를 식별하는 운동 마스크를 생성한다.
  • 감지된 전경 물체를 영상 프레임에서 제거하여 인painting을 위한 손상된 입력으로 간주되는 누락 영역을 생성한다.
  • 전역적 문맥과 국소적 텍스처 제약 조건을 사용해 누락된 이미지 콘텐츠를 예측하기 위해 CNN 기반의 인코더-디코더 네트워크(오토에인코드어 기반)를 훈련시킨다.
  • 구조적 일致성과 현실감을 향상시키기 위해 적대적 손실과 재구성 손실을 융합한 하이브리드 GAN 프레임워크를 활용한다.
  • 중앙 영역 인painting을 수행한 후 포isson 블렌딩을 적용하여 비정규형 모양의 누락 영역에까지 적용 가능한 방법으로 확장한다.
  • GAN 후속 단계에서 세분적 인paint링 네트워크를 통합하여 텍스처 세부 사항을 보완하고 재구성된 배경의 시각적 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1문맥 예측과 GAN을 기반으로 한 비지도 딥 러닝 접근 방식이 도전적인 조건에서 기존 수동 기능 기반 방법보다 배경 추정 성능을 뛰어나게 할 수 있는가?
  • RQ2제안된 DCP 프레임워크는 동적인 배경, 카메라 진동, 사진적 변형과 같은 복잡한 상황을 얼마나 효과적으로 처리할 수 있는가?
  • RQ3중앙 영역 인painting과 포isson 블렌딩의 통합이 배경 모델링에서 임의의 영역에 대한 인painting 품질을 얼마나 향상시키는가?
  • RQ4DCP 방법은 SBM.net 및 CDnet2014와 같은 벤치마크 데이터셋에서 특히 악천후 및 열화상 영상과 같은 도전적인 카테고리에서 어떻게 성능을 발휘하는가?
  • RQ5제안된 방법은 다양한 영상 카테고리, 즉 다양한 시나리오 복잡성과 배경 균일성 수준을 가진 영상에 대해 일반화 가능한가?

주요 결과

  • DCP는 SBM.net 데이터셋에서 기존의 여섯 가지 배경 추정 방법보다 뛰어난 성능을 보였으며, '간헐적 물체 운동' 및 '진동' 카테고리 포함 모든 카테고리에서 평균 회색 수준 오차(AGE)가 가장 낮았다.
  • CDnet2014의 '악천후' 카테고리에서 DCP는 최고의 성능을 기록했으며, 눈보라와 폭설이 극심한 상황에서도 정확한 배경 추정 결과를 보였다.
  • 열화상 카테고리에서는 DCP가 뛰어난 강건성을 보였으며, 다른 방법이 실패하는 열화상 잡음 예를 비롯해 열기 반사 및 카모플라주 효과와 같은 열화상 특이 현상도 성공적으로 처리했다.
  • CDnet2014에서 DCP는 전경 분할 성능을 크게 향상시켜 평균적으로 여섯 가지 기존 분할 알고리즘을 모두 능가했다.
  • 크고 비정형적인 전경 물체와 복잡한 배경 구조가 있는 경우, 특히 '간헐적 운동' 카테고리에서 AGE 점수가 가장 높아 인painting 정확도가 저하되는 실패 케이스가 관찰되었다.
  • 중앙 영역 인painting 이후 포isson 블렌딩을 적용함으로써, 비직사각형 형태의 누락 영역에 대해 재구성 영역의 시각적 일관성이 효과적으로 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.