Skip to main content
QUICK REVIEW

[논문 리뷰] UniVTG: Towards Unified Video-Language Temporal Grounding

Kevin Qinghong Lin, Pengchuan Zhang|arXiv (Cornell University)|2023. 07. 31.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

UniVTG는 스케일러블한 가짜 레이블 데이터를 사용하여 한 개의 공식으로 순간 검색, 하이라이트 검출, 영상 요약을 통합하는 통합 프레임워크를 제안한다. 민감도가 높은 이중 스트림 모델과 다양한 시간 레이블을 통한 대규모 사전 훈련을 통해 QVHighlights, Charades-STA, QFVS를 포함한 7개 벤치마크에서 최신 기술 성능을 달성하며, 강력한 제로샷 일반화 성능을 보인다.

ABSTRACT

Video Temporal Grounding (VTG), which aims to ground target clips from videos (such as consecutive intervals or disjoint shots) according to custom language queries (e.g., sentences or words), is key for video browsing on social media. Most methods in this direction develop taskspecific models that are trained with type-specific labels, such as moment retrieval (time interval) and highlight detection (worthiness curve), which limits their abilities to generalize to various VTG tasks and labels. In this paper, we propose to Unify the diverse VTG labels and tasks, dubbed UniVTG, along three directions: Firstly, we revisit a wide range of VTG labels and tasks and define a unified formulation. Based on this, we develop data annotation schemes to create scalable pseudo supervision. Secondly, we develop an effective and flexible grounding model capable of addressing each task and making full use of each label. Lastly, thanks to the unified framework, we are able to unlock temporal grounding pretraining from large-scale diverse labels and develop stronger grounding abilities e.g., zero-shot grounding. Extensive experiments on three tasks (moment retrieval, highlight detection and video summarization) across seven datasets (QVHighlights, Charades-STA, TACoS, Ego4D, YouTube Highlights, TVSum, and QFVS) demonstrate the effectiveness and flexibility of our proposed framework. The codes are available at https://github.com/showlab/UniVTG.

연구 동기 및 목표

  • 다양한 영상 시간 기반(영화 검색, 하이라이트 검출, 영상 요약) 작업을 하나의 확장 가능한 프레임워크로 통합하는 것.
  • 세부적인 시간 레이블 부족 문제를 해결하기 위해 CLIP를 활용한 데이터 레이블링 기반의 스케일러블한 가짜 레이블 생성 기법을 개발하여 다양한 레이블 유형(점, 간격, 곡선)을 지원하는 것.
  • 이중 스트림 모odal 융합과 다중 헤드 디코딩을 통해 모든 VTG 작업과 레이블 유형을 처리할 수 있는 유연한 단일 모델 아키텍처를 설계하는 것.
  • 이질적인 레이블을 기반으로 한 대규모 시간 기반 사전 훈련을 통해 향상된 제로샷 및 피처샷 일반화 능력을 확보하는 것.

제안 방법

  • 각 영상가 클립의 시퀀스로 분할하고, 각 클립에 점 수준, 간격 수준, 곡선 수준의 레이블을 쿼리 조건부 요소로 연결하는 통합 VTG 공식을 제안한다.
  • 오픈-보이드, 다양한 소스(이미지 캡션, 영상 설명 등)에서 유래한 스케일러블하고 세밀한 가짜 레이블을 생성하기 위해 CLIP 기반의 데이터 딜리케이션 파이프라인을 도입한다.
  • 모든 레이블 유형에서 시각 및 언어 특징을 효과적으로 융합하기 위해 단일 스트림 융합과 이중 스트림 정렬 경로를 갖춘 이중 스트림 모델을 설계한다.
  • 점 수준, 간격 수준, 곡선 수준 예측을 디코딩하기 위한 세 가지 작업별 헤드를 장착하여 모든 VTG 작업에서 엔드 투 엔드 훈련을 가능하게 한다.
  • Ego4D, VideoCC, CLIP 등의 여러 데이터셋에서 420만 개의 가짜 레이블 샘플을 사용하여 통합된 사전 훈련 전략을 적용하여 일반화 가능한 시간 기반 기반 표현을 학습한다.
  • 기존 수동 레이블을 통합 형식으로 변환하는 레이블 변환 메커니즘을 적용하여 효과적인 다중 작업 학습과 성능 향상을 가능하게 한다.

실험 결과

연구 질문

  • RQ1점 수준, 간격 수준, 곡선 수준 레이블을 포함한 다양한 VTG 작업과 레이블을 효과적으로 통합 공식으로 표현할 수 있는가?
  • RQ2CLIP 기반의 가짜 레이블링은 다양한 시간 기반 작업에 대해 스케일러블하고 고품질의 감독 신호를 생성하는 데 얼마나 효과적인가?
  • RQ3특정 작업에 맞게 미세조정 없이도 단일 통합 모델이 여러 VTG 작업에서 뛰어난 성능을 달성할 수 있는가?
  • RQ4통합된 이질적인 레이블을 기반으로 한 대규모 사전 훈련이 시간 기반 작업에서 제로샷 및 피처샷 일반화 능력을 얼마나 향상시키는가?
  • RQ5다양한 레이블 유형(점, 간격, 곡선) 중에서 각각의 기여도는 전체 프레임워크 성능에 어떤 영향을 미치는가?

주요 결과

  • UniVTG는 QVHighlights에서 순간 검색 작업에서 52.54 mAP, 하이라이트 검출에서 54.48 mAP를 기록하여 전용 모델보다 뛰어난 성능을 달성한다.
  • 통합 데이터로 사전 훈련한 UniVTG는 영상 요약 작업에서 QFVS에서 45.99 F-score를 기록하여 이전 최고 기록보다 4.62 포인트 높다.
  • 모델는 강력한 제로샷 일반화 능력을 보이며, 다양한 레이블로 사전 훈련한 경우, 미리 정의된 레이블이 아닌 도메인에서도 성능 향상이 이루어지며, 순간 검색 작업에서 비통합 사전 훈련 대비 4.62 포인트 mAP 향상이 있었다.
  • 절단 실험 결과 곡선 수준 레이블이 사전 훈련에서 가장 효과적이며, 세 가지 레이블 유형을 모두 조합하면 최고의 성능을 기록한다.
  • 통합 코퍼스의 0%에서 100%로 사전 훈련 데이터를 확장할수록 순간 검색 및 하이라이트 검출 작업에서 일관된 성능 향상이 관찰되었다.
  • 레이블 변환을 통한 통합 공식은 비통합 사전 훈련 대비 하이라이트 검출에서 1.28 mAP, 순간 검색에서 4.62 mAP 향상된 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.