[논문 리뷰] Tem-adapter: Adapting Image-Text Pretraining for Video Question Answer
Tem-Adapter는 CLIP과 같은 이미지-텍스트 사전학습 모델을 영상 질의응답(VideoQA)에 적응시키기 위해 시간적 정렬기(Temporal Aligner)와 의미적 정렬기(Semantic Aligner)를 도입한 경량 어댑터 프레임워크를 제안한다. 시간적 정렬기는 언어 유도 자동회귀 학습을 통해 영상의 동적 특성을 포착하고, 의미적 정렬기는 영상 조건부 디코딩을 통해 텍스트 표현을 정교화한다. 이는 최소한의 파라미터 업데이트로 최신 기술 수준(SOTA)의 성능을 달성하며, 기존 어댑터 및 프롬프트 튜닝 방법보다 뛰어나다.
Video-language pre-trained models have shown remarkable success in guiding video question-answering (VideoQA) tasks. However, due to the length of video sequences, training large-scale video-based models incurs considerably higher costs than training image-based ones. This motivates us to leverage the knowledge from image-based pretraining, despite the obvious gaps between image and video domains. To bridge these gaps, in this paper, we propose Tem-Adapter, which enables the learning of temporal dynamics and complex semantics by a visual Temporal Aligner and a textual Semantic Aligner. Unlike conventional pretrained knowledge adaptation methods that only concentrate on the downstream task objective, the Temporal Aligner introduces an extra language-guided autoregressive task aimed at facilitating the learning of temporal dependencies, with the objective of predicting future states based on historical clues and language guidance that describes event progression. Besides, to reduce the semantic gap and adapt the textual representation for better event description, we introduce a Semantic Aligner that first designs a template to fuse question and answer pairs as event descriptions and then learns a Transformer decoder with the whole video sequence as guidance for refinement. We evaluate Tem-Adapter and different pre-train transferring methods on two VideoQA benchmarks, and the significant performance improvement demonstrates the effectiveness of our method.
연구 동기 및 목표
- CLIP와 같은 사전학습된 이미지-텍스트 모델을 활용하여 대규모 영상-언어 모델을 훈련하는 데 드는 높은 비용을 줄이기 위해.
- VideoQA에서 정적 이미지 이해와 동적 영상 이해 사이의 도메인 갭을 메우기 위해.
- 백본을 미세조정하지 않고도 언어 유도 자동회귀 목표를 통해 영상 내 시간적 의존성을 학습하기 위해.
- 템플릿 기반 정렬과 영상 조건부 텍스트 생성을 통해 웹 크롤링 텍스트와 VideoQA 질문-답변 쌍 사이의 의미적 갭을 줄이기 위해.
- 최소한의 파라미터와 효율적인 추론을 통해 강력한 VideoQA 성능를 달성하기 위해.
제안 방법
- 영상 프레임 간 의존성을 모델링하기 위해 트랜스포머 인코더를 사용하고, 과거 시각적 특징과 언어 유도를 바탕으로 미래 프레임을 예측하기 위해 조건부 트랜스포머 디코더를 사용하는 시간적 정렬기를 도입한다.
- 디코더가 과거 프레임과 이벤트 진행 상황에 대한 언어 기술을 기반으로 미래 영상 프레임을 재구성하도록 하는 언어 유도 자동회귀 작업을 활용한다.
- 질문-답변 쌍을 서술적 이벤트 기술로 융합하기 위해 규칙 기반 템플릿을 설계하여 사전학습과 최종 작업 사이의 의미 갭을 줄인다.
- 전체 영상 시퀀스를 컨텍스트로 삼아 어텐션을 수행함으로써 텍스트 임베딩을 정교화하는 트랜스포머 디코더를 갖춘 의미적 정렬기를 구현한다. 이를 통해 영상-텍스트 상호작용을 가능하게 한다.
- 미래 프레임의 자동회귀 예측을 감독하기 위해 재구성 손실(PSNR)을 사용하여 시간적 역학의 정확한 모델링을 장려한다.
- CLIP의 시각 및 텍스트 인코더에 어댑터를 적용하여 백본을 미세조정하지 않고도 파라미터 효율적인 적응을 가능하게 한다.
실험 결과
연구 질문
- RQ1CLIP와 같은 사전학습된 이미지-텍스트 모델을 전체 미세조정 없이 VideoQA에 효과적으로 적응시킬 수 있는가?
- RQ2언어 유도 자동회귀 작업을 도입함으로써 영상 이해에서 시간적 모델링이 향상되는가?
- RQ3템플릿 기반 텍스트 정렬과 영상 조건부 디코딩이 사전학습과 VideoQA 사이의 의미 갭을 줄이는가?
- RQ4제안된 구성 요소인 시간적 정렬기와 의미적 정렬기가 성능에 개별적으로 및 종합적으로 기여하는가?
- RQ5최소한의 파라미터 업데이트와 낮은 추론 비용으로 어댑터가 SOTA 성능을 달성할 수 있는가?
주요 결과
- Tem-Adapter는 SUTD-TrafficQA 벤치마크에서 46.0%의 정확도를 기록하여 다음으로 우수한 방법(클립-어댑터)보다 11.2个百分点 높게 기록했다.
- 모델은 높은 정확도를 유지하면서도 영상당 추론 시간을 5.32ms로 줄여 효율성을 입증했다.
- 절단 실험 결과, 시간적 정렬기나 의미적 정렬기를 제거할 경우 성능에 심각한 하락이 발생하여 이들의 필수성을 확인했다.
- 언어 유도 자동회귀 작업은 시간적 모델링을 향상시키며, 시간적 정렬기와 언어 유도가 모두 사용될 경우 PSNR가 27.4에서 29.1로 상승했다.
- 이 방법은 다양한 이미지-텍스트 사전학습 모델에 일반화되며, 추가 파라미터 3.62M만으로도 강력한 성능을 유지한다.
- 정성적 결과는 Tem-Adapter가 이벤트 수준의 동적 특성을 학습하고, 다중모odal 상호작용을 통해 영상 이벤트 이해를 향상시킨다는 것을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.