Skip to main content
QUICK REVIEW

[논문 리뷰] LaT: Latent Translation with Cycle-Consistency for Video-Text Retrieval

Jinbin Bai, Chunhui Liu|arXiv (Cornell University)|2022. 07. 11.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 공통의 공동 잠재 공간에 의존하지 않고 비디오-텍스트 검색에서 모odal 갭을 해소하기 위해 사이클 일致성을 갖춘 잠재 번역 프레임워크인 LaT를 제안한다. 학습 가능한 쿼리 가중치를 갖춘 디코더를 사용해 시각적 및 텍스트적 잠재 공간 간의 이중 방향 번역을 학습하고 사이클 일치성을 강제함으로써, LaT는 공동 공간 방법보다 내모달 정보를 더 잘 유지하며 MSR-VTT, MSVD, DiDeMo에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Video-text retrieval is a class of cross-modal representation learning problems, where the goal is to select the video which corresponds to the text query between a given text query and a pool of candidate videos. The contrastive paradigm of vision-language pretraining has shown promising success with large-scale datasets and unified transformer architecture, and demonstrated the power of a joint latent space. Despite this, the intrinsic divergence between the visual domain and textual domain is still far from being eliminated, and projecting different modalities into a joint latent space might result in the distorting of the information inside the single modality. To overcome the above issue, we present a novel mechanism for learning the translation relationship from a source modality space $\mathcal{S}$ to a target modality space $\mathcal{T}$ without the need for a joint latent space, which bridges the gap between visual and textual domains. Furthermore, to keep cycle consistency between translations, we adopt a cycle loss involving both forward translations from $\mathcal{S}$ to the predicted target space $\mathcal{T'}$, and backward translations from $\mathcal{T'}$ back to $\mathcal{S}$. Extensive experiments conducted on MSR-VTT, MSVD, and DiDeMo datasets demonstrate the superiority and effectiveness of our LaT approach compared with vanilla state-of-the-art methods.

연구 동기 및 목표

  • 비디오-텍스트 검색에서 시각적 및 텍스트적 도메인 간의 본질적 모달 갭을 해결하기 위해.
  • 다른 모달리티를 공통의 공동 잠재 공간에 투영함으로써 발생하는 내모달 정보의 왜곡을 완화하기 위해.
  • 통합된 임베딩 공간에 의존하지 않고도 시각적 및 텍스트적 잠재 공간 간의 강력한 번역 메커니즘을 학습하기 위해.
  • 이중 방향 번역에서 사이클 일관성을 강제하여 정렬과 특징 무결성을 향상시키기 위해.
  • 모달 특화 표현 유지로 인해 더 나은 교차 모달 검색 성능을 달성하기 위해.

제안 방법

  • 학습 가능한 쿼리 매개변수 $Q_G$ 및 $Q_F$를 사용해 시각적 및 텍스트적 잠재 공간 간의 번역을 위한 이중 디코더 아키텍처를 제안한다.
  • 교차 모달 매핑을 가능하게 하기 위해 정방향 번역 $G: \mathcal{S} \to \mathcal{T}'$ 과 역방향 번역 $F: \mathcal{T}' \to \mathcal{S}$ 를 도입한다.
  • 이중 번역 후 일관성을 확보하기 위해 $v \approx G(F(v))$ 와 $t \approx F(G(t))$ 를 통한 사이클 일관성 제약 조건을 강제한다.
  • 양방향 번역 경로를 최적화하기 위해 사이클 손실을 사용하여 정렬을 향상시키고 분포 이탈을 줄인다.
  • CLIP 스타일의 사전학습을 활용한 대조 학습을 수행하지만, 공동 공간 투영 대신 모달 특화 번역을 도입한다.
  • 차원이 감소된 시각화와 코사인 유사도 분석을 활용해 향상된 모달 융합을 검증한다.

실험 결과

연구 질문

  • RQ1공동 잠재 공간을 피할 수 있을까? 비디오-텍스트 검색에서 강력한 교차 모달 정렬을 달성할 수 있는가?
  • RQ2공동 공간에서 표준 대조 학습에 비해 사이클 일관성 잠재 번역이 내모달 정보를 더 잘 유지하는가?
  • RQ3학습 가능한 쿼리 가중치를 갖춘 디코더가 시각과 언어 간의 교차 모달 번역 무결성을 향상시키는가?
  • RQ4기본 성능 기준에서 제안된 방법이 최신 기술 수준의 베이스라인에 비해 검색 정확도에서 어떻게 비교되는가?
  • RQ5사이클 일관성이 모달 갭을 줄이고 검색 성능을 향상시키는 데 어떤 영향을 미치는가?

주요 결과

  • LaT는 MSR-VTT, MSVD, DiDeMo 데이터셋에서 최신 기술 수준의 성능을 달성하며, 순수한 최신 기술 수준 방법을 초월한다.
  • 번역된 공간에서 일치하는 이미지-텍스트 쌍 간의 코사인 유사도(GT 및 FV)는 원래 공간보다 일관되게 높으며, 더 나은 정렬을 나타낸다.
  • 동일한 의미 개념(예: 'Apple')의 번역된 임베딩 간의 코사인 유사도는 다른 개념 간의 유사도보다 뚜렷하게 높으며, 효과적인 융합을 확인한다.
  • 그림 4의 시각화 결과에 따르면, LaT는 CLIP보다 텍스트 및 시각적 임베딩을 더 잘 융합하며, 일치하는 쌍의 클러스터링이 더 타이트하다.
  • 번역 후 텍스트 설명과 해당 이미지 간의 유사도가 높아(예: 'Running man'의 경우 0.58 vs. CLIP의 0.27), 모달 갭이 감소함을 입증한다.
  • 사이클 일관성 손실은 이중 번역 후 원래 임베딩을 일관되게 재구성함으로써 번역의 무결성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.