Skip to main content
QUICK REVIEW

[논문 리뷰] Query-based Video Summarization with Pseudo Label Supervision

Jia-Hong Huang, Luka Murn|arXiv (Cornell University)|2023. 07. 04.
Video Analysis and SummarizationComputer Science인용 수 3
한 줄 요약

이 논문은 기존의 인간 레이블링된 프레임 수준 레이블에서 유도된 세그먼트 수준 가짜 레이블을 활용하여 모델의 사전 훈련을 향상시키는 자기지도 학습 기반 쿼리 기반 비디오 요약 방법을 제안한다. 맥락 인식 쿼리 인코딩을 위한 의미 강화기와 다중 모odal 상호작용을 위한 상호 주의 메커니즘을 도입함으로써, TVSum, SumMe, QueryVS 벤치마크에서 각각 F1 점수 68.4, 52.4, 55.3을 기록하며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Existing datasets for manually labelled query-based video summarization are costly and thus small, limiting the performance of supervised deep video summarization models. Self-supervision can address the data sparsity challenge by using a pretext task and defining a method to acquire extra data with pseudo labels to pre-train a supervised deep model. In this work, we introduce segment-level pseudo labels from input videos to properly model both the relationship between a pretext task and a target task, and the implicit relationship between the pseudo label and the human-defined label. The pseudo labels are generated based on existing human-defined frame-level labels. To create more accurate query-dependent video summaries, a semantics booster is proposed to generate context-aware query representations. Furthermore, we propose mutual attention to help capture the interactive information between visual and textual modalities. Three commonly-used video summarization benchmarks are used to thoroughly validate the proposed approach. Experimental results show that the proposed video summarization algorithm achieves state-of-the-art performance.

연구 동기 및 목표

  • 비용이 많이 드는 인간 레이블링으로 인한 쿼리 기반 비디오 요약의 데이터 부족 문제를 해결하기 위해.
  • 기존의 프레임 수준 레이블에서 파생된 세그먼트 수준 가짜 레이블을 활용하여 모델의 일반화 능력을 향상시키기 위해.
  • 맥락 인식 의미 강화기를 통해 쿼리 표현 학습을 향상시켜 쿼리 의존적 요약 성능을 향상시키기 위해.
  • 시각적 및 텍스처적 모달 간의 상호작용을 상호 주의 메커니즘을 통해 포착하기 위해.
  • 완전 레이블링 데이터에 대한 최소한의 의존도를 가지고 표준 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 기존 인간 레이블링된 프레임 수준 레이블에서 세그먼트 수준 가짜 레이블을 생성하여 사전 훈련 태스크의 지도 신호로 활용하기 위해.
  • 이러한 가짜 레이블을 사용하여 사전 훈련을 수행함으로써, 쿼리 기반 요약에 대한 미세조정 이전에 초기화 및 시간적 모델링을 향상시키기 위해.
  • 맥락 인식 쿼리 임베딩을 생성하여 쿼리 의미를 더 잘 포착할 수 있도록 맥락 인식 의미 강화기를 도입하기 위해.
  • 추론 중에 시각적 및 텍스처적 특징을 동적으로 정렬하고 융합하기 위해 상호 주의 메커니즘을 활용하기 위해.
  • 2D 및 3D ResNet-34 백본을 ImageNet과 Kinetics에서 사전 훈련된 것을 사용하여 프레임 수준 및 세그먼트 수준의 시각적 특징을 추출하기 위해.
  • 일관된 입력 차원을 확보하기 위해 프레임 반복 전처리 및 표준 정규화를 적용하기 위해.
Fig. 1 : Query-based video summarization. A video is summarized based on textual queries. The summarization algorithm runs independently for each query.
Fig. 1 : Query-based video summarization. A video is summarized based on textual queries. The summarization algorithm runs independently for each query.

실험 결과

연구 질문

  • RQ1프레임 수준 레이블에서 유도된 세그먼트 수준 가짜 레이블이 쿼리 기반 비디오 요약을 위한 자기지도 학습 사전 훈련에 효과적으로 기여할 수 있는가?
  • RQ2맥락 인식 의미 강화기는 쿼리 의존적 비디오 요약을 위한 쿼리 표현 학습을 어떻게 향상시키는가?
  • RQ3시각적 및 텍스처적 모달 간의 상호 주의 메커니즘이 표준 크로스 주의 또는 연결 방식에 비해 모델 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 자기지도 학습 방법이 기존의 완전 레이블링 및 약한 레이블링 기반 베이스라인을 초월하는가?
  • RQ5이 방법은 길이와 콘텐츠 분포가 다양한 비디오 데이터셋 간에도 일반화 가능한가?

주요 결과

  • 제안된 방법은 TVSum에서 F1 점수 68.4, SumMe에서 52.4, QueryVS에서 55.3을 기록하며, 기존의 완전 레이블링 및 약한 레이블링 방법을 모두 초월하는 최신 기술 수준 성능을 달성한다.
  • 제거 실험을 통해 모든 구성 요소—가짜 레이블 사전 훈련, 의미 강화기, 상호 주의 메커니즘—이 베이스라인 대비 성능 향상에 뚜렷한 기여를 한다는 것이 확인되었다.
  • 세그먼트 수준 가짜 레이블은 인간 검증 없이도, 프레임 수준 레이블과의 일치로 인해 효과적인 시간적 지도 신호를 제공한다.
  • 의미 강화기는 문맥적 쿼리 의미를 더 효과적으로 포착함으로써 전통적인 Bag-of-Words (BoW) 임베딩을 능가한다.
  • 상호 주의 메커니즘은 다중 모달 특징 간의 상호작용을 향상시켜 더 정확한 쿼리 의존적 비디오 클립 선택을 가능하게 한다.
  • 다양한 길이와 콘텐츠 분포를 가진 데이터셋 간에서도 모델은 높은 성능 유지를 유지하며, 강건성과 일반화 능력을 입증한다.
Fig. 2 : Flowchart of the proposed self-supervision method for query-based video summarization. The model is pre-trained by the textual-spatial features from the Mutual Attention Mechanism and pseudo segment-level labels. The completely trained video summary generator exploits the fully-connected la
Fig. 2 : Flowchart of the proposed self-supervision method for query-based video summarization. The model is pre-trained by the textual-spatial features from the Mutual Attention Mechanism and pseudo segment-level labels. The completely trained video summary generator exploits the fully-connected la

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.