Skip to main content
QUICK REVIEW

[논문 리뷰] Determining the best attributes for surveillance video keywords generation

Liangchen Liu, Arnold Wiliem|arXiv (Cornell University)|2016. 02. 21.
Video Analysis and Summarization인용 수 3
한 줄 요약

이 논문은 의미 있는 속성 간 공유 구조적 패턴을 활용하여 감시 비디오 키워드 생성을 위한 최적의 속성 발굴 방법을 자동으로 선택하는 새로운 방법을 제안한다. PiCoDeS, 스펙트럴 해싱, LSH와 같은 방법을 평가하여 PiCoDeS가 가장 높은 키워드 정확도(77.7% 히트율)를 달성함을 입증하며, 백오프워즈 특징에 의존하지 않으면서도 높은 품질의 비디오 기술을 유지하면서 수동 레이블링 작업을 크게 줄였다.

ABSTRACT

Automatic video keyword generation is one of the key ingredients in reducing the burden of security officers in analyzing surveillance videos. Keywords or attributes are generally chosen manually based on expert knowledge of surveillance. Most existing works primarily aim at either supervised learning approaches relying on extensive manual labelling or hierarchical probabilistic models that assume the features are extracted using the bag-of-words approach; thus limiting the utilization of the other features. To address this, we turn our attention to automatic attribute discovery approaches. However, it is not clear which automatic discovery approach can discover the most meaningful attributes. Furthermore, little research has been done on how to compare and choose the best automatic attribute discovery methods. In this paper, we propose a novel approach, based on the shared structure exhibited amongst meaningful attributes, that enables us to compare between different automatic attribute discovery approaches.We then validate our approach by comparing various attribute discovery methods such as PiCoDeS on two attribute datasets. The evaluation shows that our approach is able to select the automatic discovery approach that discovers the most meaningful attributes. We then employ the best discovery approach to generate keywords for videos recorded from a surveillance system. This work shows it is possible to massively reduce the amount of manual work in generating video keywords without limiting ourselves to a particular video feature descriptor.

연구 동기 및 목표

  • 감시 비디오 키워드 생성에서 자동 속성 발굴에 대한 체계적인 비교 방법 부족 문제를 해결하기 위해.
  • 확장된 수동 레이블링에 대한 의존도를 줄여 스케일러빌리티와 미리보지 않은 이벤트에 대한 적응성 제한을 완화하기 위해.
  • 다양한 발굴 방법 간에서 가장 의미 있는 속성을 식별하는 선택 프레임워크를 개발하기 위해.
  • 실제 감시 비디오 데이터셋에서 프레임워크를 검증하고 정확하고 인간이 이해할 수 있는 키워드 생성의 효과성을 입증하기 위해.

제안 방법

  • 의미 있는 속성 간 공유 구조를 기반으로 한 거리 함수를 사용하여 발견된 속성의 의미성 수준을 측정한다.
  • 기존에 알려진 의미 있는 속성 집합을 '기준 척도'로 삼아 다양한 자동 속성 발굴 방법을 평가하고 비교한다.
  • 이 방법은 두 개의 속성 데이터셋에서 PiCoDeS, 스펙트럴 해싱(SH), 로컬리티-센서티브 해싱(LSH)을 비교하는 데 적용된다.
  • 성능 평가 시에는 각 비디오의 정확히 식별된 키워드의 정밀도(히트율)를 사용하며, 결과는 속성 및 동작별로 집계된다.
  • 추가적인 수동 레이블링이 필요 없이 최고 성능을 보이는 속성 발굴 방법을 선택할 수 있도록 한다.
  • 선택된 방법을 사용해 감시 비디오에 대한 엔드 투 엔드 키워드 생성을 지원하여 수동 작업을 최소화한다.

실험 결과

연구 질문

  • RQ1감시 비디오 키워드 생성을 위한 자동 속성 발굴 방법 중에서 가장 의미 있는 의미적 속성을 생성하는 방법은 무엇인가요?
  • RQ2수동 애너테이션에 의존하지 않고 다양한 속성 발굴 방법을 객관적으로 비교할 수 있는 방법은 무엇인가요?
  • RQ3의미 있는 속성 간 공유 구조적 패턴을 활용해 속성 품질에 대한 신뢰할 수 있는 측도를 정의할 수 있는가요?
  • RQ4제안된 선택 방법은 다양한 데이터셋과 비디오 콘텐츠에서 일관되게 최고 성능을 보이는 방법을 식별할 수 있는가요?
  • RQ5선택된 방법을 통해 수동 레이블링 작업을 얼마나 줄일 수 있으며, 동시에 높은 키워드 정확도를 유지할 수 있는가요?

주요 결과

  • PiCoDeS는 테스트된 데이터셋에서 가장 높은 키워드 히트율인 77.7%를 기록했으며, 스펙트럴 해싱(55.9%)과 LSH(48.3%)를 크게 앞서나갔다.
  • PiCoDeS에 의해 발견된 대부분의 속성은 히트율이 70% 이상이었으며, 두 속성은 100% 정확도를 달성했다.
  • 이 방법은 인간 레이블링 작업(HITs)의 수를 훈련 샘플 수 N에서 발견된 속성 수 J로 줄여 시간과 비용을 크게 절감할 수 있었다.
  • 평가 결과, 제안된 거리 함수가 가장 의미 있는 속성 집합을 효과적으로 식별함을 확인하여, 이는 선택 기준으로서의 신뢰성을 입증했다.
  • 특정 비디오 특징 기술자에 제약을 받지 않고도 확장 가능하고 저비용의 비디오 키워드 생성이 가능함을 입증했다.
  • 결과적으로 의미 있는 속성 간 구조적 패턴을 활용해 자동 속성 발굴를 효과적으로 평가하고 선택할 수 있음을 보여주며, 감시 시스템에 실용적인 구현 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.