Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Shot Dense Video Captioning by Jointly Optimizing Text and Moment

Yongrae Jo, Seongyun Lee|arXiv (Cornell University)|2023. 07. 05.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

ZeroTA는 냉각된 GPT-2와 CLIP를 사용하여 텍스트 생성과 순간 위치 지정을 공동 최적화하는 새로운 제로샷 밀도 비디오 캡셔닝 방법을 제안한다. 학습 가능한 소프트 순간 마스크와 쌍별 시간적 IoU 손실을 활용하며, 훈련 데이터 없이도 ActivityNet Captions에서 최신 기술을 초월하는 성능을 달성한다. 또한, 훈련 데이터 없이도 도메인 외부 설정에서 뛰어난 강건성을 보여준다.

ABSTRACT

Dense video captioning, a task of localizing meaningful moments and generating relevant captions for videos, often requires a large, expensive corpus of annotated video segments paired with text. In an effort to minimize the annotation cost, we propose ZeroTA, a novel method for dense video captioning in a zero-shot manner. Our method does not require any videos or annotations for training; instead, it localizes and describes events within each input video at test time by optimizing solely on the input. This is accomplished by introducing a soft moment mask that represents a temporal segment in the video and jointly optimizing it with the prefix parameters of a language model. This joint optimization aligns a frozen language generation model (i.e., GPT-2) with a frozen vision-language contrastive model (i.e., CLIP) by maximizing the matching score between the generated text and a moment within the video. We also introduce a pairwise temporal IoU loss to let a set of soft moment masks capture multiple distinct events within the video. Our method effectively discovers diverse significant events within the video, with the resulting captions appropriately describing these events. The empirical results demonstrate that ZeroTA surpasses zero-shot baselines and even outperforms the state-of-the-art few-shot method on the widely-used benchmark ActivityNet Captions. Moreover, our method shows greater robustness compared to supervised methods when evaluated in out-of-domain scenarios. This research provides insight into the potential of aligning widely-used models, such as language generation models and vision-language models, to unlock a new capability: understanding temporal aspects of videos.

연구 동기 및 목표

  • 밀도 높은 비디오 캡셔닝의 높은 주석 비용 문제를 해결하기 위해, 훈련 데이터나 주석 없이 제로샷 학습을 가능하게 하기 위해.
  • 단일 입력 비디오만을 사용하여 테스트 시점에 텍스트 생성과 시간적 순간 위치 지정을 엔드 투 엔드로 공동 최적화하기 위해.
  • 학습 가능한 소프트 순간 마스크와 쌍별 시간적 IoU 손실을 도입하여 다수의 이벤트 탐지에 유용한 다각도적이고 정확한 캡셔닝을 향상시키기 위해.
  • 감독 학습 모델이 일반적으로 실패하는 도메인 외부 설정에서의 강건성을 입증하기 위해.
  • 냉각된 언어 모델과 시각-언어 모델을 정렬시켜 영상에서 시간적 이해를 가능하게 하는 잠재력을 탐색하기 위해.

제안 방법

  • 학습 가능한 중심과 너비로 파arameter화된 소프트 순간 마스크를 도입하여 비디오의 시간적 세그먼트에 미세하게 주목할 수 있도록 한다.
  • 학습 가능한 프리픽스 파라미터만 최적화하는 프리픽스 튜닝을 사용하여 냉각된 GPT-2 언어 모델을 적응시킨다.
  • 생성된 텍스트와 시각적 특징 간의 CLIP 대비 매칭 점수를 최대화하기 위해 소프트 순간 마스크와 프리픽스 파라미터를 공동 최적화한다.
  • 생성된 토큰을 CLIP를 통해 시각적 표현과 정렬하기 위해 시각 손실($L_{vision}$)을 적용한다.
  • 학습된 프리픽스와 비디오 특징에 조건부로 일관된 캡셔닝을 생성하도록 언어 모델을 장려하기 위해 언어 손실($L_{language}$)을 적용한다.
  • 비디오 내 다수의 이벤트에 대해 서로 다른, 겹치지 않는 순간 마스크를 유도하기 위해 쌍별 시간적 IoU 손실($L_{ptIoU}$)을 도입한다.

실험 결과

연구 질문

  • RQ1훈련 데이터나 주석 없이 제로샷 환경에서 밀도 높은 비디오 캡셔닝을 달성할 수 있는가?
  • RQ2텍스트 생성과 순간 위치 지정을 공동 최적화하는 것이 두 단계적 접근 방식보다 캡셔닝 품질과 다양성을 향상시킬 수 있는가?
  • RQ3GPT-2와 CLIP와 같은 냉각된 모델만으로 구성된 방법이 벤치마크 데이터셋에서 감독 학습 및 소수의 샘플을 사용한 방법을 능가할 수 있는가?
  • RQ4도메인 외부 설정에서, 이 방법은 미세조정된 감독 학습 모델에 비해 어떻게 성능을 발휘하는가?
  • RQ5소프트 순간 마스크와 쌍별 IoU 손실이 비디오 내 다수의 서로 다른 이벤트를 효과적으로 탐지하는 데 기여하는가?

주요 결과

  • ZeroTA는 ActivityNet Captions 벤치마크에서 모든 제로샷 베이스라인을 능가하며, 2.6 CIDEr, 7.5 SPICE, 2.7 MSpot의 성능을 달성한다.
  • 10억 프레임의 비디오-텍스트 데이터로 사전학습된 최신 기술인 소수의 샘플을 사용한 Vid2Seq 모델을 1%의 데이터로 미세조정한 경우조차도 앞서는 성능을 보였다.
  • YouCook2에서는 ZeroTA가 Vid2Seq보다 성능이 열 劣하나, 이는 캡셔닝 스타일의 불일치 때문이었다. ZeroTA는 전통적인 캡셔닝을 생성하지만, YouCook2는 작업 중심의 지시문을 사용한다.
  • ZeroTA는 도메인 외부 설정에서 뛰어난 강건성을 보이며, 완전히 감독 학습된 모델이 심하게 성능 저하를 보이는 상황에서도 성능을 유지한다.
  • 훈련 데이터 없이도 텍스트와 순간 위치 지정의 공동 최적화가 두 단계적 방법보다 더 효과적임을 입증하였다.
  • 쌍별 시간적 IoU 손실은 모델이 다수의 서로 다른 이벤트를 탐지하도록 효과적으로 유도하여 캡셔닝의 다양성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.