[논문 리뷰] TVLT: Textless Vision-Language Transformer
TVLT는 텍스트 기반 모듈(예: 토큰화 또는 음성 인식)에 의존하지 않고 원시 비디오 프레임과 오디오 스펙트로그램에서 직접 시각-언어 표현을 학습하는 텍스트 없는 시각-언어 트랜스포머를 제안한다. 이 모델은 다중모달 작업에서 텍스트 기반 모델과 유사한 성능을 달성하면서 파라미터를 2/3 감소시키고 추론 속도를 28배로 향상시킨다.
In this work, we present the Textless Vision-Language Transformer (TVLT), where homogeneous transformer blocks take raw visual and audio inputs for vision-and-language representation learning with minimal modality-specific design, and do not use text-specific modules such as tokenization or automatic speech recognition (ASR). TVLT is trained by reconstructing masked patches of continuous video frames and audio spectrograms (masked autoencoding) and contrastive modeling to align video and audio. TVLT attains performance comparable to its text-based counterpart on various multimodal tasks, such as visual question answering, image retrieval, video retrieval, and multimodal sentiment analysis, with 28x faster inference speed and only 1/3 of the parameters. Our findings suggest the possibility of learning compact and efficient visual-linguistic representations from low-level visual and audio signals without assuming the prior existence of text. Our code and checkpoints are available at: https://github.com/zinengtang/TVLT
연구 동기 및 목표
- 작성된 언어의 존재를 전제로 하지 않고 원시 시각적 및 청각 신호에서 학습하는 시각-언어 모델을 개발하는 것.
- 시각-언어 표현 학습에서 자동 음성 인식(ASR) 및 토큰화와 같은 텍스트 전용 구성 요소를 제거하는 것.
- 통합된 다중모달 무관(tranformer 아키텍처를 통해 계산 효율성과 모델의 경량화를 향상시키는 것.
- 비디오 및 오디오와 같은 저수준 감각 자극에서 효과적인 시각-언어 표현을 직접 학습할 수 있는지 조사하는 것.
- 텍스트 감독 없이도 다중모달 작업(예: 시각질의, 검색, 감성 분석)에서의 성능 평가를 수행하는 것.
제안 방법
- TVLT는 모달리티에 특화된 설계 없이 원시 비디오 프레임과 오디오 스펙트로그램을 처리하는 동일한 트랜스포머 인코더 및 디코더를 사용한다.
- 모델은 시각적 및 청각적 패치 모두에 대해 마스크된 자동에코딩(MAE)을 통해 사전학습을 수행하며, 연속된 비디오 프레임과 스펙트로그램의 마스크된 영역을 재구성한다.
- 사전학습 중에 대비 모델링을 적용하여 비디오 및 오디오 표현 간의 정렬을 도모함으로써 다중모달 이해를 향상시킨다.
- 학습된 음성 탐지 헤드를 사용하여 감지된 음성 영역에만 오디오 마스킹을 적용함으로써 최소한의 계산 비용으로 성능 향상을 달성한다.
- 공유된 트랜스포머 공간에서 비디오 및 오디오 입력을 처리하기 위해 공동 인코더를 사용함으로써 다중모달 특징 학습을 가능하게 한다.
- 공유된 가중치를 가진 별도의 디코더를 사용하여 비디오 및 오디오 재구성에 대해, 공동 디코더보다 정확도와 효율성 측면에서 뛰어난 성능을 달성한다.
실험 결과
연구 질문
- RQ1통합된 다중모달 무관 트랜스포머는 텍스트 감독 없이 원시 비디오 및 오디오에서 효과적인 시각-언어 표현을 직접 학습할 수 있는가?
- RQ2ASR 및 토큰화와 같은 텍스트 전용 구성 요소를 제거하면 계산의 중복성이 감소하고 성능 손실 없이 추론 속도가 향상되는가?
- RQ3비디오 질의 응답(VQA) 및 검색과 같은 주요 다중모달 작업에서 텍스트 기반 모델과 비교해 텍스트 없는 모델의 성능는 어떠한가?
- RQ4다양한 오디오 마스킹 전략과 사전학습 목표가 주요 작업 정확도에 어떤 영향을 미치는가?
- RQ5모델은 특히 감정 분류 작업에서 비언어적 청각적 신호를 효과적으로 포착할 수 있는가?
주요 결과
- TVLT는 비디오 검색( MSR-VTT에서 R@1: 22.3)과 VQA( VQAv2에서 정확도: 58.6%)에서 경쟁력 있는 성능을 달성하며 최신 텍스트 기반 모델과 유사한 성능를 보였다.
- 이와 같은 하드웨어 환경에서 모델 파라미터를 텍스트 기반 모델의 1/3으로 줄였고, 추론 속도는 28배 빨라졌다.
- 감지된 음성 영역에 대한 오디오 마스킹은 모든 벤치마크에서 성능 향상을 이끌었으며, MSR-VTT에서 R@1 22.3, VQAv2에서 정확도 58.6%를 기록했다.
- 공동 인코더는 모달리티에 특화된 인코더보다 뛰어난 성능을 보였으며, MSR-VTT에서 R@1 10.2, VQAv2에서 정확도 54.6%를 달성하여 효과적인 다중모달 표현 학습을 입증했다.
- 공유된 가중치를 가진 별도의 디코더는 공동 디코더보다 더 뛰어난 성능( R@1 22.3, 정확도 58.6%)을 보였으며, 이는 다중모달 재구성에 대해 더 나은 최적화를 가능하게 함을 시사한다.
- 마스크된 자동에코딩(MAE)과 음성 인지 마스킹(VAM) 사전학습 목표의 조합이 가장 뛰어난 주요 작업 성능을 보였으며, 개별적으로 적용했을 때보다 뛰어났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.