Skip to main content
QUICK REVIEW

[논문 리뷰] Image Conditioned Keyframe-Based Video Summarization Using Object Detection

Neeraj Baghel, Suresh Chandra Raikwar|arXiv (Cornell University)|2020. 09. 11.
Video Analysis and Summarization참고 문헌 24인용 수 8
한 줄 요약

이 논문은 사용자 선호도 모델링을 향상시키기 위해 객체 검출 및 전반적 색채도 특징을 활용하는 이미지 조건부 키프레임 기반 영상 요약 방법을 제안한다. 수학적 손실 함수와 분산 기반 임계값 설정을 도입함으로써 재중복성을 감소시키고, UTE 데이터셋에서 평균 F1 스코어 57.06%를 달성하여 최신 기술 대비 11.01% 높은 성능을 보였으며, 실시간보다 7.81배 빠른 속도로 영상 처리를 수행한다.

ABSTRACT

Video summarization plays an important role in selecting keyframe for understanding a video. Traditionally, it aims to find the most representative and diverse contents (or frames) in a video for short summaries. Recently, query-conditioned video summarization has been introduced, which considers user queries to learn more user-oriented summaries and its preference. However, there are obstacles in text queries for user subjectivity and finding similarity between the user query and input frames. In this work, (i) Image is introduced as a query for user preference (ii) a mathematical model is proposed to minimize redundancy based on the loss function & summary variance and (iii) the similarity score between the query image and input video to obtain the summarized video. Furthermore, the Object-based Query Image (OQI) dataset has been introduced, which contains the query images. The proposed method has been validated using UT Egocentric (UTE) dataset. The proposed model successfully resolved the issues of (i) user preference, (ii) recognize important frames and selecting that keyframe in daily life videos, with different illumination conditions. The proposed method achieved 57.06% average F1-Score for UTE dataset and outperforms the existing state-of-theart by 11.01%. The process time is 7.81 times faster than actual time of video Experiments on a recently proposed UTE dataset show the efficiency of the proposed method

연구 동기 및 목표

  • 사용자 주관성 문제를 해결하기 위해 텍스트 쿼리 대신 사용자 선호도를 더 잘 반영하는 이미지 쿼리를 사용하는 것.
  • 요약의 분산과 유사도 점수에 기반한 새로운 수학적 모델을 통해 선택된 키프레임 간의 재중복성을 최소화하는 것.
  • 다양한 조명 조건에서 일상 영상의 키프레임 선택 정확도를 향상시키는 것.
  • 영상 요약 작업에서 쿼리 이미지 선택을 지원하기 위해 새로운 데이터셋인 객체 기반 쿼리 이미지(OQI)를 개발하는 것.
  • 저수준 시각적 특징과 적응형 임계값 설정을 활용해 일반 하드웨어에서 효율적이고 실시간 영상 요약을 구현하는 것.

제안 방법

  • 사용자 선호도 신호로 이미지 쿼리를 사용하며, 국소적 특징으로 객체 검출을 활용하고 전반적 특징으로 주목할 만한 영역을 활용한다.
  • 쿼리 이미지와 영상 프레임 간의 유사도를 기반으로 프레임 선택 점수를 계산하기 위해 손실 함수를 도입한다.
  • 선택된 키프레임 간의 재중복성을 최소화하기 위해 요약 분산 공식을 적용한다.
  • 표준편차 기반 적응형 임계값 설정 방법을 활용해 동적으로 키프레임을 선택한다.
  • 교차율(IoU)을 사용한 이분 그래프 매칭 방법을 통해 정밀도, 재현도 및 F1 스코어를 계산한다.
  • 영상 분할, 특징 추출, 프레임 점수 계산, 요약 생성의 파ipeline 워크플로우를 통해 영상을 처리한다.

실험 결과

연구 질문

  • RQ1영상 요약에서 텍스트 쿼리에 비해 이미지 쿼리가 사용자 선호도를 더 잘 모델링할 수 있는가?
  • RQ2요약의 분산과 유사도 점수에 기반한 수학적 모델을 통해 선택된 키프레임 간의 재중복성을 어떻게 최소화할 수 있는가?
  • RQ3객체 검출과 색채도 특징을 조합함으로써 키프레임 선택 정확도는 어느 정도 향상되는가?
  • RQ4유사도와 분산에 기반한 손실 함수가 실제 일상 영상(에고세트릭 영상)의 요약 성능 향상에 기여하는가?
  • RQ5기존 최신 기술 대비 제안된 방법은 속도와 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 UTE 데이터셋에서 평균 F1 스코어 57.06%를 달성하여 기존 최신 기술 대비 11.01% 높은 성능을 보였다.
  • 처리 시간을 실제 영상 지속시간의 7.81배 빠르게 줄여 거의 실시간 요약을 가능하게 하였다.
  • 시각적 결과는 '또는'(OR) 논리로 이미지 쿼리를 사용할 때 관련 샷(예: 사람 또는 차량)을 효과적으로 포착함을 보여주었다.
  • 영상 요약 작업에서 쿼리 이미지 선택을 지원하기 위해 OQI 데이터셋을 성공적으로 구축하였다.
  • 표준편차 기반 적응형 임계값 설정이 다양한 조명 조건에서 키프레임 선택의 강인성을 향상시켰다.
  • 객체 검출(국소적)과 색채도(전반적) 특징의 조합이 요약 품질 향상과 사용자 선호도 일치도를 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.