[논문 리뷰] Building A Large Concept Bank for Representing Events in Video
이 논문은 위키하우에서 실생활 사건을, 플리커에서 개념 관련 이미지 태그를 추출하여 4,876개의 개념으로 구성된 다섯 계층의 계층적 온톨로지로 정리된 대규모 이벤트 중심 개념 라이브러리인 Concept Bank을 소개한다. 다중 커널 선형 서포트 벡터 머신을 사용해 개념 검출기 학습하고, 의미적 매칭 방법을 통해 이벤트 쿼리에 관련된 개념을 선별하여 TRECVID 및 컬럼비아 소비자 비디오 데이터셋에서 지도 학습 기반 이벤트 모델링과 제로샷 검색 모두에서 최신 기술 수준(SOTA)의 성능을 달성한다.
Concept-based video representation has proven to be effective in complex event detection. However, existing methods either manually design concepts or directly adopt concept libraries not specifically designed for events. In this paper, we propose to build Concept Bank, the largest concept library consisting of 4,876 concepts specifically designed to cover 631 real-world events. To construct the Concept Bank, we first gather a comprehensive event collection from WikiHow, a collaborative writing project that aims to build the world's largest manual for any possible How-To event. For each event, we then search Flickr and discover relevant concepts from the tags of the returned images. We train a Multiple Kernel Linear SVM for each discovered concept as a concept detector in Concept Bank. We organize the concepts into a five-layer tree structure, in which the higher-level nodes correspond to the event categories while the leaf nodes are the event-specific concepts discovered for each event. Based on such tree ontology, we develop a semantic matching method to select relevant concepts for each textual event query, and then apply the corresponding concept detectors to generate concept-based video representations. We use TRECVID Multimedia Event Detection 2013 and Columbia Consumer Video open source event definitions and videos as our test sets and show very promising results on two video event detection tasks: event modeling over concept space and zero-shot event retrieval. To the best of our knowledge, this is the largest concept library covering the largest number of real-world events.
연구 동기 및 목표
- 고수준 비디오 표현을 위한 종합적이고 이벤트 중심의 개념 라이브러리 부족 문제를 해결하기 위해.
- 복잡한 이벤트 표현을 위한 웹 이미지에서 시각적으로 탐지 가능한 개념을 자동으로 탐색할 수 있는 확장 가능한 자동화된 방법을 개발하기 위해.
- 특히 제로샷 이벤트 탐지에 있어 대규모 학습 비디오에 의존하지 않고도 효과적인 개념 기반 비디오 표현을 가능하게 하기 위해.
- 의미적 매칭과 효율적 검색을 지원하는 체계적인 온톨로지로 개념을 정리하기 위해.
- 다양하고 의미적으로 관련성이 높은 대규모 개념 라이브러리를 활용해 이벤트 탐지 성능을 향상시키기 위해.
제안 방법
- 일상생활 활동을 넓게 커버하기 위해 공동으로 운영되는 지침 지식 기반인 위키하우에서 631개의 실생활 사건을 수집한다.
- 각 사건에 대해 이벤트 제목을 사용해 플리커를 검색하여 이미지 컬렉션을 확보하고, 관련 태그를 후보 개념으로 추출한다.
- 자동 의미적 개념 발견 기법을 적용해 이미지 태그에서 이벤트 관련 개념을 필터링 및 선별한다.
- 해당 이미지 세트를 양성 샘플로, 무작위 이미지를 부정 샘플로 사용해 각 발견된 개념에 대해 다중 커널 선형 서포트 벡터 머신을 학습시킨다.
- 이벤트 카테고리가 상위 계층에 위치하고 이벤트 전용 개념이 잎새에 위치하는 다섯 계층의 계층적 트리 구조로 모든 개념을 정리한다.
- 어휘 임베딩을 사용한 의미적 매칭 방법을 개발하여 주어진 텍스트 이벤트 쿼리에 대해 관련성을 기준으로 개념을 순위 매기고, 표현에 사용할 상위-k개의 개념을 선별한다.
실험 결과
연구 질문
- RQ1웹 스케일의 이미지 데이터와 공동 지식 기반을 활용해 자동으로 대규모 이벤트 중심 개념 라이브러리를 구축할 수 있는가?
- RQ2자동으로 발견된 개념 기반 표현이 비디오에서 복잡한 이벤트 탐지에 얼마나 효과적으로 기여하는가?
- RQ3개념 라이브러리의 커버리지와 관련성 수준이 제로샷 이벤트 검색 성능에 얼마나 큰 영향을 미치는가?
- RQ4사전에 구축된 개념과 쿼리 이벤트 간의 의미적 매칭을 통해 학습 비디오 없이도 효과적인 개념 선택이 가능한가?
- RQ5유의미한 개념 수가 증가함에 따라 개념 기반 비디오 표현의 성능가 어떻게 변화하는가?
주요 결과
- Concept Bank에는 631개의 실생활 사건을 커버하는 4,876개의 이벤트 전용 개념을 포함하고 있어 문헌상에서 가장 큰 규모의 라이브러리이다.
- 제안된 의미적 매칭 방법은 학습 비디오 없이도 텍스트 기반 기술 뿐만으로도 쿼리 이벤트에 관련된 개념을 성공적으로 식별한다.
- TRECVID 2013 및 컬럼비아 소비자 비디오 데이터셋에서, Concept Bank은 지도 학습 기반 이벤트 모델링과 제로샷 검색 모두에서 최신 기술 수준의 성능을 달성한다.
- 제로샷 검색 성능은 Concept Bank에서 선택된 개념 수가 증가함에 따라 향상되며, Classemes의 경우 관련 없는 개념 포함로 인해 성능이 저하된다.
- 계산 비용은 관리 가능하다: 이벤트 쿼리당 의미적 매칭은 약 78초가 소요되며, 비디오의 개념 점수 생성은 평균 약 110초가 소요된다.
- 상위 순위의 개념을 사용한 비디오 의미적 요약은 질적 결과에서 볼 수 있듯이 의미 있는 의미적 내용을 효과적으로 드러낸다. (각 비디오당 상위 5개 개념 리스트 기반)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.