Skip to main content
QUICK REVIEW

[논문 리뷰] TS2-Net: Token Shift and Selection Transformer for Text-Video Retrieval

Yuqi Liu, Pengfei Xiong|arXiv (Cornell University)|2022. 07. 16.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

TS2-Net는 텍스트-비디오 검색을 위한 보다 정교한 공간-시간 표현을 향상시키기 위해 토큰 이동 및 선택 모듈을 갖춘 새로운 트랜스포머 기반 비디오 인코더를 제안한다. 프레임 간 및 공간 패치 간에 정보가 풍부한 토큰을 동적으로 이동하고 선택함으로써 미세한 운동과 작은 물체의 모델링을 향상시키며, MSRVTT, VATEX, LSMDC, ActivityNet, DiDeMo에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Text-Video retrieval is a task of great practical value and has received increasing attention, among which learning spatial-temporal video representation is one of the research hotspots. The video encoders in the state-of-the-art video retrieval models usually directly adopt the pre-trained vision backbones with the network structure fixed, they therefore can not be further improved to produce the fine-grained spatial-temporal video representation. In this paper, we propose Token Shift and Selection Network (TS2-Net), a novel token shift and selection transformer architecture, which dynamically adjusts the token sequence and selects informative tokens in both temporal and spatial dimensions from input video samples. The token shift module temporally shifts the whole token features back-and-forth across adjacent frames, to preserve the complete token representation and capture subtle movements. Then the token selection module selects tokens that contribute most to local spatial semantics. Based on thorough experiments, the proposed TS2-Net achieves state-of-the-art performance on major text-video retrieval benchmarks, including new records on MSRVTT, VATEX, LSMDC, ActivityNet, and DiDeMo.

연구 동기 및 목표

  • 기존 비디오 인코더가 미세한 공간-시간 세부 정보, 예를 들어 미세한 운동과 작은 물체를 포착하는 데에 한계가 있음을 해결하기 위해.
  • 시간과 공간 전역에서 비디오 토큰에 대한 동적이고 적응적인 처리를 가능하게 하여 텍스트-비디오 검색에서 비디오 표현을 향상시키기 위해.
  • 고정된 아키텍처나 사전 훈련된 백본에 의존하지 않고 국소적 의미를 향상시키는 비디오 인코더를 설계하기 위해.
  • MSRVTT, VATEX, LSMDC, ActivityNet, DiDeMo를 포함한 여러 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 이웃 프레임 간에 전체 공간 토큰 특징을 교환하여 완전한 표현을 유지하고 국소적 운동을 포착하는 토큰 이동 모듈을 도입한다.
  • 클래스 토큰 [CLS]과의 상관관계 및 공간-시간적 맥락을 기반으로 상위-K개의 가장 정보가 풍부한 토큰을 식별하고 유지하는 토큰 선택 모듈을 활용한다.
  • 학습 가능한 선택 네트워크를 사용하여 토큰 중요도를 추정하고 국소적 공간 의미와 두드러진 시각적 엔티티에 집중한다.
  • 프레임 단위의 유사도 집계를 적용하여 텍스트와 비디오 표현을 정교한 수준에서 정렬한다.
  • 공유된 공간에서 텍스트 및 비디오 임베딩을 정렬하기 위해 비디오-언어 대비 학습을 최적화한다.
  • 시퀀스 무결성을 유지하면서도 동적 토큰 조작을 지원할 수 있도록 표준 트랜스포머 아키텍처를 수정한다.

실험 결과

연구 질문

  • RQ1프레임 간에 동적 토큰 이동이 비디오 표현에서 미세한 시간적 운동을 모델링하는 데에 개선을 이끌 수 있는가?
  • RQ2공간-시간 토큰에 대한 선택적 주의가 텍스트-비디오 검색에서 작은 또는 두드러진 시각적 물체를 인식하는 데에 기여하는가?
  • RQ3토큰 이동과 선택을 조합함으로써 다양한 텍스트-비디오 검색 벤치마크에서 일관된 성능 향상이 이루어지는가?
  • RQ4CLIP4Clip 및 QB-Norm과 같은 강력한 베이스라인에 비해 TS2-Net은 미세한 시각적 및 운동 측면을 다룰 때 어떻게 성능을 내는가?
  • RQ5제안된 방법이 다양한 시각적 복잡도와 질의 유형을 가진 데이터셋 간에서 얼마나 일반화되는가?

주요 결과

  • TS2-Net은 MSRVTT, VATEX, LSMDC, ActivityNet-Caption, DiDeMo에서 새로운 최신 기술 수준의 성능을 달성하였으며, VATEX에서 R@1이 최대 1.5% 향상되었고, LSMDC에서 MeanR가 1.5% 향상되었다.
  • 작은 물체와 미세한 운동에 중점을 둔 MSR-VTT의 도전적인 서브셋(103개 질의)에서 TS2-Net은 R@1이 79.6을 기록하여 CLIP4Clip의 39.8보다 뚜렷이 뛰어나다.
  • 제거 실험을 통해 토큰 이동 및 토큰 선택 모듈이 각각 검색 정확도를 향상시킨다는 것이 확인되었으며, 이는 각 모듈의 독립적 기여를 입증한다.
  • Inverted Softmax를 추론 시 사용하지 않더라도 TS2-Net은 VATEX와 LSMDC에서 QB-Norm를 능가하여 더 강력한 내재 표현 학습 능력을 보여준다.
  • 정성적 결과에서는 '마이크폰'과 같은 작은 물체나 '대화하는 것', '손을 마찰하는 것'과 같은 미세한 동작을 포함한 비디오를 정확히 검색하는 것으로 나타났다.
  • 복잡한 캡션과 장시간 비디오를 포함한 다양한 데이터셋 간에서 모델이 강력한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.