Skip to main content
QUICK REVIEW

[논문 리뷰] Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval

Jiamian Wang, Guohao Sun|arXiv (Cornell University)|2024. 03. 26.
Video Analysis and Summarization인용 수 4
한 줄 요약

이 논문은 T-MASS를 제안하며, 비디오의 풍부하고 반복적인 의미를 더 잘 포착하기 위해 텍스트를 통합 임베딩 공간 내의 분포(즉, '질량')로 모델링하는 새로운 확률적 텍스트 임베딩 방법이다. 유사도 인식 반경 모듈과 지원 텍스트 정규화를 도입함으로써 T-MASS는 텍스트와 비디오 간의 정렬을 향상시켜 MSRVTT, LSMDC, DiDeMo, VATEX, Charades를 포함한 다섯 가지 벤치마크에서 R@1이 3%~6.3% 향상되며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

The increasing prevalence of video clips has sparked growing interest in text-video retrieval. Recent advances focus on establishing a joint embedding space for text and video, relying on consistent embedding representations to compute similarity. However, the text content in existing datasets is generally short and concise, making it hard to fully describe the redundant semantics of a video. Correspondingly, a single text embedding may be less expressive to capture the video embedding and empower the retrieval. In this study, we propose a new stochastic text modeling method T-MASS, i.e., text is modeled as a stochastic embedding, to enrich text embedding with a flexible and resilient semantic range, yielding a text mass. To be specific, we introduce a similarity-aware radius module to adapt the scale of the text mass upon the given text-video pairs. Plus, we design and develop a support text regularization to further control the text mass during the training. The inference pipeline is also tailored to fully exploit the text mass for accurate retrieval. Empirical evidence suggests that T-MASS not only effectively attracts relevant text-video pairs while distancing irrelevant ones, but also enables the determination of precise text embeddings for relevant pairs. Our experimental results show a substantial improvement of T-MASS over baseline (3% to 6.3% by R@1). Also, T-MASS achieves state-of-the-art performance on five benchmark datasets, including MSRVTT, LSMDC, DiDeMo, VATEX, and Charades.

연구 동기 및 목표

  • 비디오의 전체 의미적 풍부성을 포착하는 데에 단일 점 텍스트 임베딩의 한계를 해결하기 위해.
  • 텍스트를 유연하고 적응 가능한 분포로 모델링하여 통합 임베딩 공간 내에서 텍스트와 비디오 표현 간의 정렬을 향상시키기 위해.
  • 텍스트 임베딩의 저항성 있는 의미 범위를 가능하게 하여 검색의 강건성과 정확도를 향상시키기 위해.
  • 학습 과정에서 텍스트 질량의 학습을 편향 없이 효과적으로 정규화하는 전략을 개발하기 위해.
  • 텍스트 질량의 확률적 성격을 최대한 활용하기 위해 추론을 재구성하여 더 나은 검색 성능을 달성하기 위해.

제안 방법

  • T-MASS는 텍스트를 임베딩 공간 내의 단일 점이 아닌 확률적 임베딩(즉, '질량')으로 모델링하며, CLIP 기반 텍스트 특징에 재파arameterization를 적용한다.
  • 유사도 인식 반경 모듈은 쿼리 텍스트와 비디오 쌍 간의 유사도에 따라 텍스트 질량의 척도를 동적으로 조정한다.
  • 학습 중에 텍스트 질량의 위치와 척도를 함께 제어하기 위해 지원 텍스트 벡터를 도입한다.
  • 텍스트 질량 분포를 학습하기 위해 확률적 대칭 교차 엔트로피 손실을 활용하여 관련 비디오 임베딩과의 정렬을 향상시킨다.
  • 추론을 재구성하여 각 쿼리당 다수의 확률적 텍스트 임베딩을 샘플링하고, 각 비디오 후보와 가장 가까운 것을 선택함으로써 검색 정밀도를 향상시킨다.
  • 샘플된 확률적 텍스트 포인트와 비디오 임베딩 간의 대비 학습을 통해 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1단일 점이 아닌 확률적 분포로 텍스트를 모델링할 경우 텍스트-비디오 검색 성능이 향상되는가?
  • RQ2텍스트-비디오 쌍의 의미적 유사도에 기반해 텍스트 질량의 척도를 어떻게 적응적으로 결정할 수 있는가?
  • RQ3확률적 텍스트 질량을 정규화하기 위해 가장 효과적인 학습 전략은 무엇인가? 이는 학습 편향을 피하면서 정렬을 향상시키는 데 기여한다.
  • RQ4추론 중에 텍스트 질량의 전반적인 특성을 활용할 경우 단일 임베딩을 사용할 때보다 검색 정확도에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 다양한 비디오 길이와 캡션 스타일을 가진 다양한 비디오-텍스트 데이터셋에 일반화되는가?

주요 결과

  • T-MASS는 MSRVTT, LSMDC, DiDeMo, VATEX, Charades를 포함한 다섯 가지 벤치마크 데이터셋에서 강력한 기준 모델 대비 R@1이 3%~6.3% 향상되며 최신 기술 수준(SOTA) 성능을 달성한다.
  • 확률적 임베딩을 사용할 경우 관련이 없는 텍스트-비디오 쌍 간의余弦 유사도가 크게 감소하여 임베딩 공간 내에서의 분리가 향상됨을 나타낸다.
  • 확률적 임베딩의 사용은 관련 쌍에 대해 더 낮은 교차 엔트로피 손실을 초래하며, 이는 유사도가 높고 정렬이 향상됨을 반영한다.
  • 최적의 지원 텍스트 정규화 가중치 α = 1.2가 가장 뛰어난 검색 성능을 내며, 이는 텍스트 질량에 대한 적절한 제어의 중요성을 입증한다.
  • 입력 비디오 프레임 수가 다양함에도 불구하고 T′ = 12에서 24 프레임까지의 Charades에서 일관된 성능 향상이 관찰되어 강건함을 보였다.
  • 20회의 샘플링 시도를 통해 추론를 수행할 경우 정확도와 계산 비용의 균형을 잘 맞춘 안정적이고 최적의 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.