[논문 리뷰] Audio-Enhanced Text-to-Video Retrieval using Text-Conditioned Feature Alignment
이 논문은 TEFAL을 제안하며, 별도의 교차attention 블록을 사용해 음성과 영상 표현을 텍스트 쿼리에 독립적으로 정렬함으로써 관련 음성 신호의 억압을 방지하는 텍스트 조건부 특징 정렬 방법이다. 이는 네 개의 음성 기반 텍스트-영상 검색 벤치마크에서 최신 기술 수준의 성능을 달성하며, MSR-VTT에서 E-CLIP-SE 대비 Recall@1이 4퍼센트 이상 향상되었다.
Text-to-video retrieval systems have recently made significant progress by utilizing pre-trained models trained on large-scale image-text pairs. However, most of the latest methods primarily focus on the video modality while disregarding the audio signal for this task. Nevertheless, a recent advancement by ECLIPSE has improved long-range text-to-video retrieval by developing an audiovisual video representation. Nonetheless, the objective of the text-to-video retrieval task is to capture the complementary audio and video information that is pertinent to the text query rather than simply achieving better audio and video alignment. To address this issue, we introduce TEFAL, a TExt-conditioned Feature ALignment method that produces both audio and video representations conditioned on the text query. Instead of using only an audiovisual attention block, which could suppress the audio information relevant to the text query, our approach employs two independent cross-modal attention blocks that enable the text to attend to the audio and video representations separately. Our proposed method's efficacy is demonstrated on four benchmark datasets that include audio: MSR-VTT, LSMDC, VATEX, and Charades, and achieves better than state-of-the-art performance consistently across the four datasets. This is attributed to the additional text-query-conditioned audio representation and the complementary information it adds to the text-query-conditioned video representation.
연구 동기 및 목표
- 기존의 음성 강화 텍스트-영상 검색 방법이 음성과 영상의 정렬 이전에 음성과 영상을 융합함으로써 관련 음성 신호를 억압하는 한계를 해결하기 위해.
- 텍스트 쿼리에 명시적으로 조건화된 음성과 영상 표현을 학습함으로써 공동 정렬이 아닌 별도의 정렬 방식을 통해 검색 성능을 향상시키기 위해.
- 텍스트 조건부 음성 및 영상 표현이 상호 보완적인 정보를 제공함으로써 음성-영상 융합을 초월하는 검색 정확도 향상을 보여주기 위해.
- 다양하고 대규모의 영상 검색 벤치마크에서 TEFAL의 효과성을 검증하기 위해.
제안 방법
- TEFAL은 고정된 텍스트 및 영상 특징 추출기로 CLIP을, 고정된 음성 특징 추출기로 AST를 사용하여 초기 임베딩을 생성한다.
- 두 개의 독립적인 교차attention 블록을 적용한다: 하나는 텍스트-음성용, 다른 하나는 텍스트-영상용으로, 각각 텍스트가 각 모odal에 별도로 주목할 수 있도록 한다.
- 텍스트 쿼리는 각 교차attention 메커니즘에서 쿼리로 작동하며, 음성 및 영상 특징는 키와 밸류로 기능한다.
- 최종적으로 생성된 텍스트 조건부 음성 및 영상 표현을 더하여 음성 강화 영상 표현을 형성한다.
- 음성 신호가 시각적으로 존재하지 않는 경우(예: 말하는 숫자, 배경 소리 등)에도 관련 음성 신호를 유지하기 위해 공동 음성-영상 attention을 피한다.
- 확장 가능한 추론을 위해 TEFAL은 평균 풀링 기반 영상 검색 베이스라인의 상위-K 결과를 재정렬하는 데 사용되며, 성능 저하 없이 계산 비용을 감소시킨다.
실험 결과
연구 질문
- RQ1텍스트 쿼리에 대해 음성과 영상 표현을 별도로 조건화하는 것이 공동 음성-영상 정렬보다 더 나은 검색 성능을 낼 수 있는가?
- RQ2말하는 숫자나 배경 소리처럼 시각적으로 존재하지 않는 음성 신호가 있는 경우, 텍스트 조건부 음성 표현이 검색 성능 향상에 기여할 수 있는가?
- RQ3음성 강화로 인한 성능 향상은 음성과 영상 간의 보완적 정보 때문인가, 아니면 단순히 모odal 정렬의 향상 때문인가?
- RQ4높은 추론 비용을 수반하는 대규모 영상 데이터셋에 적용했을 때 TEFAL의 실용적 확장성은 어떻게 되는가?
주요 결과
- MSR-VTT에서 TEFAL은 Recall@1이 49.4%를 기록하며, E-CLIP-SE 대비 4퍼센트 이상 높아 최신 기술 수준임을 입증한다.
- LSMDC에서 TEFAL은 Recall@1을 평균 풀링 기반 베이스라인의 20.9%에서 26.8%로 향상시켜 다양한 데이터셋에서 일관된 성능 향상을 보였다.
- 영상 전용 베이스라인 대비 텍스트 조건부 음성 표현의 추가로 성능이 2.5% 향상되어 음성이 검색에 기여하는 가치를 확인했다.
- 평균 풀링으로부터 상위 10퍼센트의 검색 공간을 선별한 후 TEFAL을 사용해 재정렬했을 때 성능 저하가 거의 없었으며, 이는 확장성의 증거였다.
- 음성 및 영상 임베딩을 스택하거나 제3의 교차attention 블록을 사용하는 융합 방법은 단순한 덧셈보다 성능이 열 劣했으며, 융합이 간단하지 않음을 시사했다.
- 제거 실험 결과, 음성과 영상에 대해 별도의 교차attention을 사용하는 것이 음성-영상 융합보다 우수하며, 관련 음성 신호의 억압를 방지한다는 점을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.