Skip to main content
QUICK REVIEW

[논문 리뷰] VideoStory Embeddings Recognize Events when Examples are Scarce

Amirhossein Habibian, Thomas Mensink|arXiv (Cornell University)|2015. 11. 08.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 서술성과 다중모态 예측 가능성 사이의 균형을 맞춘 공동 목표를 사용하여 영상 특징을 텍스트 기술과 함께 공통적인 의미 공간에 통합하는 VideoStory라는 영상 표현 학습 방법을 제안한다. 웹 스케일의 영상-텍스트 쌍을 활용하고 관련 용어를 최적화함으로써, VideoStory는 TRECVID 및 Columbia Consumer Videos 데이터셋에서 이전 방법들을 능가하는 소수 예제 및 제로 예제 이벤트 인식 성능을 달성한다.

ABSTRACT

This paper aims for event recognition when video examples are scarce or even completely absent. The key in such a challenging setting is a semantic video representation. Rather than building the representation from individual attribute detectors and their annotations, we propose to learn the entire representation from freely available web videos and their descriptions using an embedding between video features and term vectors. In our proposed embedding, which we call VideoStory, the correlations between the terms are utilized to learn a more effective representation by optimizing a joint objective balancing descriptiveness and predictability.We show how learning the VideoStory using a multimodal predictability loss, including appearance, motion and audio features, results in a better predictable representation. We also propose a variant of VideoStory to recognize an event in video from just the important terms in a text query by introducing a term sensitive descriptiveness loss. Our experiments on three challenging collections of web videos from the NIST TRECVID Multimedia Event Detection and Columbia Consumer Videos datasets demonstrate: i) the advantages of VideoStory over representations using attributes or alternative embeddings, ii) the benefit of fusing video modalities by an embedding over common strategies, iii) the complementarity of term sensitive descriptiveness and multimodal predictability for event recognition without examples. By it abilities to improve predictability upon any underlying video feature while at the same time maximizing semantic descriptiveness, VideoStory leads to state-of-the-art accuracy for both few- and zero-example recognition of events in video.

연구 동기 및 목표

  • 라벨이 부족하거나 존재하지 않을 경우 영상 내 이벤트 인식 문제를 해결하기 위해.
  • 영상 특징으로부터 유의미하게 기술 가능하고 동시에 높은 예측 가능성을 지닌 영상 표현을 개발하기 위해.
  • 자유롭게 이용 가능한 웹 영상과 그에 해당하는 텍스트 기술을 기반으로 학습함으로써 소수 및 제로 예제 설정에서의 일반화 능력을 향상시키기 위해.
  • 외관, 운동, 음성 등의 다양한 모odal을 통합된 의미 임베딩에 통합하여 예측 능력을 향상시키기 위해.
  • 영상 예제 없이 텍스트 쿼리만으로도 정확한 이벤트 인식을 가능하게 하기 위해.

제안 방법

  • 외관, 운동, 음성 특징에 대한 다중모달 예측 가능성 손실을 기반으로 영상 특징과 용어 벡터 간의 공동 임베딩을 학습하기 위해.
  • 용어가 영상에 얼마나 잘 기술되는지(서술성)와 영상 특징이 용어를 얼마나 잘 예측하는지(예측 가능성) 사이의 균형을 맞춘 공동 목표를 최적화하기 위해.
  • 외관, 운동, 음성 특징을 공통 의미 공간에서 융합하여 예측 성능을 향상시키는 VideoStoryF라는 변형을 도입하기 위해.
  • 제로 예제 인식 성능을 향상시키기 위해 용어 민감도 서술성 손실을 사용하는 VideoStory0라는 변형을 제안하기 위해.
  • 수동으로 주석이 달린 속성에 의존하지 않고 웹에서 수집한 영상-텍스트 쌍을 사용하여 임베딩을 사전 학습하기 위해.
  • 모든 기초 영상 특징(예: CNN, 개선된 밀도적 궤적)에 VideoStory 임베딩을 적용하여 그 예측 능력을 향상시키기 위해.

실험 결과

연구 질문

  • RQ1수동으로 주석이 달린 속성에 의존하지 않고 웹 영상과 그 기술을 기반으로 의미적 영상 표현을 효과적으로 학습할 수 있는가?
  • RQ2서술성과 다중모달 예측 가능성의 공동 최적화가 소수 및 제로 예제 설정에서의 이벤트 인식 성능을 향상시키는가?
  • RQ3공통 의미 임베딩를 통해 외관, 운동, 음성 특징을 융합하는 것이 전통적인 특징 융합 전략보다 우수한 성능을 내는가?
  • RQ4용어 민감도 서술성 손실이 텍스트 쿼리로부터의 제로 예제 이벤트 인식 성능 향상에 얼마나 효과적인가?
  • RQ5VideoStory가 소수 및 제로 예제 이벤트 검출에서 여러 벤치마크에서 최신 성능을 달성할 수 있는가?

주요 결과

  • TRECVID 2013 소수 예제 테스트 세트에서 VideoStory는 평균 정밀도(mAP) 37.1%를 기록하여 새로운 최고 기록을 수립했다.
  • 제로 예제 설정에서 VideoStory는 mAP 20.0%를 기록하여 이전 최고 성능인 18.3%를 뛰어넘었다.
  • 외관, 운동, 음성 특징을 융합하는 VideoStoryF 변형은 예측 가능성과 정확도를 향상시켜 전통적 융합 방법보다 뛰어난 성능을 보였다.
  • 용어 민감도 서술성 손실을 사용하는 VideoStory0 변형은 오직 텍스트 쿼리만으로도 정확한 인식이 가능하게 하여 강력한 제로샷 일반화 능력을 입증했다.
  • 용어 민감도 서술성 손실과 다중모달 예측 가능성 손실의 조합은 상호 보완적이며 제로 예제 인식 성능을 크게 향상시켰다.
  • VideoStory는 모든 기초 영상 특징(예: CNN, I3D, 음성)에서 예측 가능성을 향상시키면서도 높은 의미적 서술성을 유지하여 최신 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.