[논문 리뷰] Learning Audio-Video Modalities from Image Captions
이 논문은 시각 유사도를 활용하여 이미지 캡션 데이터셋(예: Conceptual Captions3M)의 캡션을 영상 및 오디오 클립으로 전이함으로써 대규모, 약한 감독을 받는 오디오-비디오 캡션 데이터셋인 VideoCC3M를 생성하는 확장 가능한 비디오 마이닝 파이프라인을 제안한다. 이 데이터로 다중모달 트랜스포머를 훈련시킬 경우 HowTo100M에 비해 클립 수가 20분의 1, 캡션 수가 100분의 1이지만 영상 검색 및 캡션 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, 동시에 강력한 제로샷 일반화 능력과 AudioCaps 및 Clotho 오디오 검색 벤치마크에서 SOTA 성능을 기록한다.
A major challenge in text-video and text-audio retrieval is the lack of large-scale training data. This is unlike image-captioning, where datasets are in the order of millions of samples. To close this gap we propose a new video mining pipeline which involves transferring captions from image captioning datasets to video clips with no additional manual effort. Using this pipeline, we create a new large-scale, weakly labelled audio-video captioning dataset consisting of millions of paired clips and captions. We show that training a multimodal transformed based model on this data achieves competitive performance on video retrieval and video captioning, matching or even outperforming HowTo100M pretraining with 20x fewer clips. We also show that our mined clips are suitable for text-audio pretraining, and achieve state of the art results for the task of audio retrieval.
연구 동기 및 목표
- 텍스트-비디오 및 텍스트-오디오 검색 분야의 진전을 저해하는 대규모, 약한 감독을 받는 비디오 및 오디오 캡션 데이터셋의 부족 문제를 해결하기 위해.
- 수동 레이블링 없이도 자동으로 이미지 캡션을 영상 및 오디오 클립으로 전이할 수 있는 확장 가능한 자동 파이프라인을 개발하기 위해.
- 다중모달 모델의 사전 훈련에 적합한 대규모, 약한 쌍화된 오디오-비디오 캡션 데이터셋을 구축하기 위해.
- 이 마이닝된 데이터로 사전 훈련된 모델가 HowTo100M로 사전 훈련된 모델와 경쟁하거나 슈퍼어리어 성능을 달성할 수 있음을 보여주기 위해, 특히 제로샷 설정에서 성능을 강조하기 위해.
- 마이닝된 데이터가 후행 오디오 검색 작업에서 강력한 성능을 지원할 수 있으며, AudioCaps 및 Clotho 벤치마크에서 SOTA 성능을 달성할 수 있음을 보여주기 위해.
제안 방법
- CLIP 기반 이미지 인코더를 사용하여 이미지 캡션 데이터셋(예: CC3M)의 이미지를 '시드' 프레임으로 삼아 영상 내에서 시각적으로 유사한 프레임을 식별한다.
- 각 매칭된 프레임을 중심으로 짧은 영상 클립(오디오 포함)을 추출하여 약한 감독을 받는 오디오-비디오 클립 쌍을 형성한다.
- 원본 이미지 캡션을 직접 마이닝된 영상 클립에 전이하여 약한 감독을 제공함으로써, 쌍화된 오디오-비디오-텍스트 샘플을 생성한다.
- 최종적으로 생성된 VideoCC3M 데이터셋을 기반으로 다중모달 오디오-비디오 트랜스포머 모델을 엔드 투 엔드로 훈련시어 영상 검색 및 캡션 작업을 수행한다.
- 다운스트림 벤치마크인 HowTo100M, AudioCaps, Clotho에서 파인튜닝하여 제로샷 및 파인튜닝 성능을 평가한다.
- 오디오 전용 및 오디오-비디오 융합 인코더를 모두 사용하여 시각 모odal이 오디오 검색 성능에 기여하는 정도를 평가한다.
실험 결과
연구 질문
- RQ1기존의 이미지 캡션 데이터셋을 시각 유사도 기반으로 사용하여 대규모, 약한 감독을 받는 오디오-비디오 캡션 데이터를 자동으로 마이닝할 수 있는가?
- RQ2마이닝된 VideoCC3M 데이터로 사전 훈련한 모델이 HowTo100M로 사전 훈련한 모델보다 영상 검색 및 캡션 작업에서 더 뛰어난 성능을 내는가, 특히 훨씬 적은 데이터로도 성능이 뛰어나게 되는가?
- RQ3마이닝된 오디오-비디오 데이터가 영상 및 오디오 검색 작업에서 강력한 제로샷 일반화 능력을 지원하는가?
- RQ4마이닝된 캡션을 사용할 때 시각 모달의 포함 여부가 오디오 검색 성능에 영향을 주는가?
- RQ5VideoCC3M로 훈련된 모델이 AudioCaps 및 Clotho와 같은 표준 오디오 검색 벤치마크에서 SOTA 성능을 달성할 수 있는가?
주요 결과
- VideoCC3M 데이터셋은 웹 영상에서 이미지 캡션 데이터를 시드로 사용하여 자동으로 마이닝된 수백만 개의 약한 쌍화된 오디오-비디오-텍스트 클립을 포함한다.
- VideoCC3M로 사전 훈련된 모델는 영상 검색 및 캡션 작업에서 경쟁력 있는 성능를 달성하며, HowTo100M 사전 훈련 대비 클립 수는 20분의 1, 텍스트 문장 수는 100분의 1로 줄였음에도 불구하고 성능을 유사하거나 초월한다.
- 모델는 오디오 검색에서 SOTA 성능을 달성하며, AudioCaps에서 R@1이 32.0으로 이전 SOTA보다 7.7점 높다. 이는 수동 오디오-텍스트 레이블링이 전혀 필요로 하지 않는다.
- VideoCC3M로 사전 훈련하면 영상 캡션 및 검색 작업에서 제로샷 성능이 크게 향상되며, 도메인 차이로 인해 HowTo100M 사전 훈련이 제로샷에서 성능이 떨어지는 것과 대비된다.
- 오디오-비디오 융합은 오디오 검색 성능을 향상시키며, Clotho에서 VideoCC3M 사전 훈련과 AudioCaps 사전 훈련을 조합했을 때 가장 뛰어난 성능를 기록한다.
- 이 방법은 기존의 이미지-텍스트 모델(예: CLIP)과 강력한 보완성을 보이며, 마이닝된 데이터는 ASR 기반 감독보다 더 다양하고 더 잘 정렬되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.