Skip to main content
QUICK REVIEW

[논문 리뷰] X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval

Satya Krishna Gorti, Noël Vouitsis|arXiv (Cornell University)|2022. 03. 28.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

X-Pool는 텍스트가 입력 텍스트와 관련성이 높은 비디오 프레임에 집중할 수 있도록 해주는 교차 모달 주의 메커니즘을 제안한다. 이는 텍스트 쿼리에 따라 비디오 풀링을 조정함으로써 텍스트-비디오 검색 성능을 향상시킨다. MSR-VTT, MSVD, LSMDC에서 최신 기술 수준(SOTA) 성능을 달성하며 Recall@1에서 최대 12%의 상대적 향상을 보였고, 장면 전환과 같은 비디오 콘텐츠 다양성에 대해 뛰어난 강건성을 입증하였다.

ABSTRACT

In text-video retrieval, the objective is to learn a cross-modal similarity function between a text and a video that ranks relevant text-video pairs higher than irrelevant pairs. However, videos inherently express a much wider gamut of information than texts. Instead, texts often capture sub-regions of entire videos and are most semantically similar to certain frames within videos. Therefore, for a given text, a retrieval model should focus on the text's most semantically similar video sub-regions to make a more relevant comparison. Yet, most existing works aggregate entire videos without directly considering text. Common text-agnostic aggregations schemes include mean-pooling or self-attention over the frames, but these are likely to encode misleading visual information not described in the given text. To address this, we propose a cross-modal attention model called X-Pool that reasons between a text and the frames of a video. Our core mechanism is a scaled dot product attention for a text to attend to its most semantically similar frames. We then generate an aggregated video representation conditioned on the text's attention weights over the frames. We evaluate our method on three benchmark datasets of MSR-VTT, MSVD and LSMDC, achieving new state-of-the-art results by up to 12% in relative improvement in Recall@1. Our findings thereby highlight the importance of joint text-video reasoning to extract important visual cues according to text. Full code and demo can be found at: https://layer6ai-labs.github.io/xpool/

연구 동기 및 목표

  • 입력 텍스트와의 관련성이 없더라도 모든 프레임을 동일하게 집계하는 텍스트 무관 비디오 풀링 방법의 한계를 해결하기 위해.
  • 텍스트와 비디오 프레임 간의 공동 추론을 가능하게 하여 가장 의미적으로 관련성이 높은 시각적 단서만을 추출함으로써 텍스트-비디오 검색 성능을 향상시키기 위해.
  • 텍스트가 동적으로 가장 관련성이 높은 비디오 부분 영역에 집중할 수 있도록 허용하는 매개변수 기반 교차 모달 주의 메커니즘을 설계하기 위해.
  • 장면 전환과 같은 비디오 콘텐츠 다양성이 증가함에 따라 검색 모델의 성능 저하 정도를 평가하기 위해.
  • 텍스트 조건부 풀링이 표준 평균 풀링 및 자기 주의 메커니즘보다 검색 성능과 강건성 면에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • X-Pool는 텍스트 쿼리에서 스케일된 디트-곱 주의를 사용하여 개별 비디오 프레임에 대한 주의 가중치를 계산함으로써, 모델이 의미적으로 관련성이 높은 부분 영역에 집중할 수 있도록 한다.
  • 이 주의 가중치는 조건부로 비디오 특징을 집계하는 데 사용되며, 입력 텍스트와 맥락적으로 일치하는 비디오 표현을 생성한다.
  • 이 방법은 사전 학습된 시각-언어 모델을 기반으로 하며, 텍스트 임bedding과 프레임 수준의 시각적 특징 간에 교차 주의를 적용한다.
  • 학습된 주의 가중치를 사용하여 프레임 특징의 가중 평균을 계산함으로써 비디오 표현을 생성함으로써, 쿼리 텍스트에 관련성이 있도록 보장한다.
  • 공유된 잠재 공간 내에서 교차 모달 유사도를 최적화하기 위해 대조 손실을 사용하여 엔드 투 엔드로 모델을 미세 조정한다.
  • 이 접근법은 MSR-VTT, MSVD, LSMDC 세 가지 벤치마크 데이터셋에서 평가되었으며, Recall@1 및 메디안 랭크와 같은 표준 검색 지표를 사용하였다.

실험 결과

연구 질문

  • RQ1평균 풀링 또는 자기 주의 메커니즘과 같은 텍스트 무관 풀링 방법에 비해 텍스트 조건부 비디오 풀링이 텍스트-비디오 검색 성능을 향상시킬 수 있는가?
  • RQ2장면 전환과 같은 비디오 콘텐츠 다양성이 증가함에 따라 검색 모델의 성능은 어떻게 저하되는가?
  • RQ3비디오에 여러 개의 서로 다른 시각적 장면이나 급격한 전환이 포함되어 있을 때 X-Pool는 높은 검색 정확도를 유지하는가?
  • RQ4X-Pool의 주의 메커니즘은 주어진 텍스트 기술에 가장 관련성이 높은 비디오 프레임을 효과적으로 국소화할 수 있는가?
  • RQ5다양한 비디오 콘텐츠 변화에 대해 강건성을 유지하면서도 여러 벤치마크에서 최신 기술 수준의 성능을 유지할 수 있는가?

주요 결과

  • X-Pool는 MSR-VTT, MSVD, LSMDC에서 새로운 최신 기술 수준 성능을 달성하였으며, 이전 방법 대비 Recall@1에서 최대 12%의 상대적 향상을 보였다.
  • 모델는 비디오 콘텐츠 다양성에 대해 뚜렷한 강건성을 보였다: 장면 전환이 증가함에 따라 메디안 랭크는 2에서 9로 증가한 반면, 평균 풀링은 2에서 46으로 증가하였다.
  • 정성적 분석을 통해 X-Pool는 복잡하거나 미묘한 상황에서도 입력 텍스트와 의미적으로 가장 일치하는 프레임에 높은 주의 가중치를 할당함을 확인하였다.
  • 주의 메커니즘이 관련이 있는 비디오 부분 영역을 성공적으로 국소화하였으며, 예를 들어 신경 과정을 묘사하는 텍스트가 있을 경우 뇌 애니메이션 프레임에 집중하였다.
  • 비디오의 시각적 다양성이 높은 경우를 포함해 모든 평가 지표에서 X-Pool는 텍스트 무관 풀링 방법보다 뛰어난 성능을 보였다.
  • 비디오에 여러 개의 장면 전환이 포함되어 있을 때도 모델는 강력한 성능을 유지하였으며, 이는 관련이 없는 시각적 간섭 요소를 효과적으로 걸러내는 능력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.