[논문 리뷰] HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training
HiTeA는 두 가지 새로운 사전 훈련 작업인 교차 모달 순간 탐색(CME)과 다중 모달 시간 관계 탐색(MTRE)을 통해 세분화된 순간 표현과 시간 관계를 모델링함으로써 영상-언어 이해를 향상시키는 계층적 시간 인식 비디오-언어 사전 훈련 프레임워크를 제안한다. 이는 특히 시간에 초점을 둔 벤치마크인 SSv2-Template (+8.6%)와 SSv2-Label (+11.1%)에서 최고 성능을 기록하며 강력한 zero-shot 일반화 능력과 향상된 시간 모델링 능력을 입증한다.
Video-language pre-training has advanced the performance of various downstream video-language tasks. However, most previous methods directly inherit or adapt typical image-language pre-training paradigms to video-language pre-training, thus not fully exploiting the unique characteristic of video, i.e., temporal. In this paper, we propose a Hierarchical Temporal-Aware video-language pre-training framework, HiTeA, with two novel pre-training tasks for modeling cross-modal alignment between moments and texts as well as the temporal relations of video-text pairs. Specifically, we propose a cross-modal moment exploration task to explore moments in videos, which results in detailed video moment representation. Besides, the inherent temporal relations are captured by aligning video-text pairs as a whole in different time resolutions with multi-modal temporal relation exploration task. Furthermore, we introduce the shuffling test to evaluate the temporal reliance of datasets and video-language pre-training models. We achieve state-of-the-art results on 15 well-established video-language understanding and generation tasks, especially on temporal-oriented datasets (e.g., SSv2-Template and SSv2-Label) with 8.6% and 11.1% improvement respectively. HiTeA also demonstrates strong generalization ability when directly transferred to downstream tasks in a zero-shot manner. Models and demo will be available on ModelScope.
연구 동기 및 목표
- 기존 영상-언어 사전 훈련 방법이 영상 전반을 전역적으로 다루며 세분화된 시간적 세부 정보와 관계를 모델링하지 못하는 한계를 해결하기 위해.
- 다양한 시간 해상도에서 영상의 계층적 시각을 도입함으로써 영상 순간과 텍스트 간의 교차 모달 정렬을 향상시키기 위해.
- 영상 순간과 그에 해당하는 텍스트 기술 간의 암묵적인 시간적 의존성을 포착하기 위해.
- 새로운 시간 왜곡 테스트를 통해 데이터셋과 모델의 시간 의존성 평가하기 위해.
- 통합적이고 계층적인 시간 인식 사전 훈련 프레임워크를 통해 영상-언어 이해 및 생성 능력을 향상시키기 위해.
제안 방법
- HiTeA는 다양한 시간 해상도에서 장시간 및 단시간 영상 클립을 생성하여 입력 영상의 계층적 표현을 만든다.
- 교차 모달 순간 탐색(CME) 작업은 긍정 및 하드 음성 단어-영상 쌍을 사용하여 공통 임bedding 공간에서 단시간 영상 표현과 관련된 텍스트 어휘를 정렬한다.
- 다중 모달 시간 관계 탐색(MTRE) 작업은 관련 단어에 의해 안내되는 단시간 영상와 텍스트에 의해 안내되는 장시간 영상 간의 다중 모달 정렬을 수행하여 다양한 시각 간의 시간 관계를 포착한다.
- 프레임워크는 영상 및 텍스트 전용 별도의 인코더를 갖는 듀얼 브랜치 아키텍처를 사용하며, 정렬 최적화를 위해 대비 학습을 적용한다.
- 시간 왜곡 테스트를 도입하여 데이터셋의 시간 의존성과 사전 훈련된 모델의 시간 왜곡에 대한 강건성을 평가한다.
- 모델은 대규모 영상-텍스트 쌍에서 사전 훈련되며, 표준 프로토콜을 사용하여 균일 샘플링과 데이터 증강을 적용해 하류 작업에서 미세조정된다.

실험 결과
연구 질문
- RQ1다양한 시간 해상도에서 영상 표현을 모델링하면 영상-언어 사전 훈련에서 세분화된 순간 이해도 향상에 기여하는가?
- RQ2사전 훈련 프레임워크가 영상 순간과 그에 해당하는 텍스트 기술 간의 암묵적인 시간 관계를 얼마나 효과적으로 포착할 수 있는가?
- RQ3기존 영상-언어 데이터셋이 정적 시각적 신호보다 시간 역학에 얼마나 의존하는가?
- RQ4계층적 시간 인식 사전 훈련 접근법이 영상-언어 하류 작업에 대해 zero-shot으로 효과적으로 일반화될 수 있는가?
- RQ5시간에 초점을 둔 벤치마크에서 기존 영상-언어 사전 훈련 모델과 비교해 본다면, 제안된 방법은 성능 면에서 어떻게 비교되는가?
주요 결과
- HiTeA는 잘 정립된 15개의 영상-언어 이해 및 생성 작업에서 최고 성능을 기록하며 다양한 벤치마크에 걸쳐 강력한 일반화 능력을 입증한다.
- 시간 이해에 중점을 두는 SSv2-Template 데이터셋에서, 이전 방법 대비 8.6% 향상된 성능을 달성한다.
- 외관과 시간 역학적 이해가 모두 필요한 SSv2-Label 데이터셋에서, 11.1% 향상된 성능을 기록하며 복잡한 시간 관계를 효과적으로 모델링할 수 있음을 입증한다.
- 모델은 강력한 zero-shot 전이 성능를 보이며, 사전 훈련 과정에서 학습된 강력하고 일반화 가능한 표현을 갖는다는 것을 시사한다.
- 제안된 시간 왜곡 테스트는 많은 기존 데이터셋이 정적 시각적 신호에 편향되어 있음을 드러내며, HiTeA가 이러한 시간 왜곡에 더 강건함을 입증한다.
- 제거 실험을 통해 CME 및 MTRE 사전 훈련 작업이 모두 모델 성능에 크게 기여하며, 특히 시간에 초점된 작업에서 두드러진 기여를 한다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.