Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Approach for Video Surveillance Indexing and Retrieval

Ali Wali, Adel M. Alimi|arXiv (Cornell University)|2013. 08. 06.
Advanced Image and Video Retrieval Techniques참고 문헌 11인용 수 7
한 줄 요약

이 논문은 비디오 프레임에서 저수준 시각적 특징(색상, 무늬, 형태, 운동)을 추출하고, 이를 바탕으로 SVM 기반 분류를 통해 고수준 개념과 이벤트를 탐지하는 다중모odal 영상 감시 인덱싱 및 검색 시스템인 MAVSIR을 제시한다. 이 시스템은 TRECVID 2009 벤치마크에서 경쟁적인 성능을 보이며, '안아주기'와 '승강차 금지'와 같은 핵심 이벤트에 대해 낮은 정규화된 탐지 비용률(NDCR) 점수를 기록하여 통합된 특징 추출 및 학습을 통한 효과적인 의미 이해 능력을 입증한다.

ABSTRACT

In this paper, we present an overview of a multimodal system to indexing and searching video sequence by the content that has been developed within the REGIMVid project. A large part of our system has been developed as part of TRECVideo evaluation. The MAVSIR platform provides High-level feature extraction from audio-visual content and concept/event-based video retrieval. We illustrate the architecture of the system as well as provide an overview of the descriptors supported to date. Then we demonstrate the usefulness of the toolbox in the context of feature extraction, concepts/events learning and retrieval in large collections of video surveillance dataset. The results are encouraging as we are able to get good results on several event categories, while for all events we have gained valuable insights and experience.

연구 동기 및 목표

  • 대규모 영상 감시 아카이브에 대한 효율적이고 사용자 중심의 접근을 해결하기 위해, 의미적 이해를 통한 콘텐츠 기반 검색을 가능하게 하기 위해.
  • 저수준 시각적 서술자들을 추출하고 통합하여 고수준 의미적 추론을 수행할 수 있는 통합적이고 확장 가능한 플랫폼을 개발하기 위해.
  • 운동 추정, 물체 분할, 개념/이벤트 탐지 기능을 하나의 프레임워크에 통합하여 영상 감시 인덱싱을 향상시키기 위해.
  • 대규모 영상 감시 시스템에 구현 가능한 실시간 압축 도메인 특징 추출을 가능하게 하기 위해.
  • 영상 콘텐츠에서 구조화된 메타데이터를 생성함으로써 다양한 맥락 기반 쿼리 지원을 가능하게 하기 위해.

제안 방법

  • 영상 감시 시퀀스에서 움직이는 물체를 탐지하고 분할하기 위해 레이어드 세트 기반의 활성 윤곽 모델을 사용한다.
  • Horn-Schunck 알고리즘을 통해 계산된 광학 흐름을 운동 추정에 사용하며, 이를 활성 윤곽 모델에 통합하여 동시에 운동과 강도 기반 분할을 수행한다.
  • 프레임당 10개의 저수준 시각적 서술자를 추출한다: 색상(히스토GRAM), 무늬(Gabor, 웨이블릿, SIFT), 형태(Hough 변환), 운동 활동(웨이블릿 기반 광학 흐름 에너지).
  • 특징들을 배경, 움직이는 물체, 핵심 프레임 특징으로 레이블링하고 조직화하여 영상 데이터를 의미적 레이블의 시퀀스로 압축한다.
  • 결합된 특징 벡터를 기반으로 단일 SVM 분류기를 훈련시켜 영상 데이터셋에서 사전 정의된 개념과 이벤트를 탐지한다.
  • 실시간 성능을 확보하기 위해 압축 도메인 처리를 지원하여 감시 응용 프로그램에 적합하게 한다.

실험 결과

연구 질문

  • RQ1저수준 시각적 특징을 어떻게 효과적으로 통합하여 감시 영상에서 고수준 영상 개념 및 이벤트 탐지 성능을 향상시킬 수 있는가?
  • RQ2통합된 운동 추정과 활성 윤곽 분할이 복잡한 감시 환경에서 물체 탐지 정확도를 얼마나 향상시킬 수 있는가?
  • RQ3통합된 특징 추출 툴박스가 영상 감시 인덱싱 및 검색 시스템의 성능과 확장성 향상에 기여할 수 있는가?
  • RQ4이 시스템은 'TRECVID 2009'와 같은 표준 벤치마크에서 이벤트 탐지 및 개념 검색 성능에서 어떻게 평가되는가?
  • RQ5결합된 특징에 대해 단일 SVM 분류기를 사용할 경우, 감시 환경에서 의미적 영상 이해에 어떤 영향을 미치는가?

주요 결과

  • '승강차 금지' 이벤트에 대해 최소 NDCR가 0.322를 기록하여, 잘못된 경고와 누락 탐지의 최소화를 위한 뛰어난 성능을 보였다.
  • '사람들 갈라짐' 이벤트의 경우 최소 NDCR가 0.953이었으며, 높은 복잡도에도 불구하고 강력한 탐지 능력을 입증했다.
  • '안아주기' 이벤트는 최소 NDCR가 0.961을 기록하여 희귀하지만 명확한 이벤트를 높은 신뢰도로 탐지함을 보였다.
  • 개념 탐지에서 높은 평균 정밀도를 기록하였으며, 개념 1, 2, 3, 5에서 최고의 성능을 기록하여 의미적 콘텐츠 인식 능력이 뛰어나다는 것을 입증했다.
  • 모든 이벤트에서 경쟁 가능한 최소 NDCR 점수를 확보하여, 저조도 실제 NDCR에 대해 특별히 최적화되지 않았음에도 불구하고 통합된 시각적 특징에서 효과적인 학습이 이루어졌음을 시사했다.
  • 특징 추출 파이프라인은 영상 데이터 복잡도를 수십만 배 이상 감소시켜 효율적인 머신러닝 및 메타데이터 생성을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.