Skip to main content
QUICK REVIEW

[논문 리뷰] DiffusionRet: Generative Text-Video Retrieval with Diffusion Model

Peng Jin, Hao Li|arXiv (Cornell University)|2023. 03. 17.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

DiffusionRet는 생성적 텍스트-비디오 검색 프레임워크를 제안하며, 노이즈에서 점진적으로 연합 확률 분포 $p(\text{candidates}, \text{query})$ 를 모델링하는 디퓨전 모델을 사용하여 높은 검색 정확도와 외부 도메인 데이터에 대한 강력한 일반화 능력을 달성한다. 생성 손실과 대조 학습을 결합함으로써 다섯 가지 벤치마크에서 최신 기술 수준의 성능을 달성하며, 뛰어난 제로샷 전이 능력을 보여준다.

ABSTRACT

Existing text-video retrieval solutions are, in essence, discriminant models focused on maximizing the conditional likelihood, i.e., p(candidates|query). While straightforward, this de facto paradigm overlooks the underlying data distribution p(query), which makes it challenging to identify out-of-distribution data. To address this limitation, we creatively tackle this task from a generative viewpoint and model the correlation between the text and the video as their joint probability p(candidates,query). This is accomplished through a diffusion-based text-video retrieval framework (DiffusionRet), which models the retrieval task as a process of gradually generating joint distribution from noise. During training, DiffusionRet is optimized from both the generation and discrimination perspectives, with the generator being optimized by generation loss and the feature extractor trained with contrastive loss. In this way, DiffusionRet cleverly leverages the strengths of both generative and discriminative methods. Extensive experiments on five commonly used text-video retrieval benchmarks, including MSRVTT, LSMDC, MSVD, ActivityNet Captions, and DiDeMo, with superior performances, justify the efficacy of our method. More encouragingly, without any modification, DiffusionRet even performs well in out-domain retrieval settings. We believe this work brings fundamental insights into the related fields. Code is available at https://github.com/jpthu17/DiffusionRet.

연구 동기 및 목표

  • 생성 모델이 텍스트-비디오 검색에서 데이터 분포 $p(\text{query})$ 를 모델링하지 못하고 외부 분포 데이터에 대해 일반화 능력이 떨어지는 제한점을 해결하기 위해.
  • 일반화 능력과 전이 능력을 향상시키기 위해 연합 분포 $p(\text{candidates}, \text{query})$ 를 포괄하는 생성적 패러다임을 탐색하기 위해.
  • 디퓨전 모델의 군집에서 세분화로의 반복적 정밀 조정 특성을 활용하여 텍스트와 비디오 간의 점진적 상관관계 학습을 가능하게 하기 위해.
  • 아키텍처 수정 없이도 도메인 내 및 도메인 외 설정 모두에서 높은 성능을 유지하는 검색 프레임워크를 개발하기 위해.
  • 생성 모델링이 교차 모odal 검색에서 정확도와 일반화 능력 면에서 비생성적 방법을 능가할 수 있음을 입증하기 위해.

제안 방법

  • 프레임워크는 노이즈에서 점차적으로 연합 확률 분포 $p(\text{candidates}, \text{query})$ 를 생성하는 디퓨전 프로세스로 텍스트-비디오 검색을 모델링한다.
  • 노이즈 제거 U-Net 아키텍처를 갖춘 디퓨전 모델을 사용하여 연합 분포 표현을 반복적으로 정밀 조정한다.
  • 생성 품질 향상을 위해 쿨리블랙-라이블러 분산 손실을 사용하여 생성기 최적화를 수행한다.
  • 특징 추출기는 대조 학습(InfoNCE) 손실을 함께 훈련시켜 분류 표현 학습을 향상시킨다.
  • 생성적 및 분류적 목표를 결합하여 연합 분포 모델링과 특징 정렬 간 균형을 맞춘다.
  • 특징 추출을 위해 베이직 트랜스포머 인코더를 사용하여 효율성과 확장성을 향상시킨다.

실험 결과

연구 질문

  • RQ1조건부 분포 $p(\text{candidates}|\text{query})$ 가 아닌 연합 분포 $p(\text{candidates}, \text{query})$ 를 모델링하는 것이 텍스트-비디오 검색에서 일반화 능력을 향상시키는가?
  • RQ2디퓨전 모델의 군집에서 세분화로의 반복적 정밀 조정 과정이 검색 작업에서 교차 모달 상관관계 학습을 향상시키는가?
  • RQ3DiffusionRet와 같은 생성 프레임워크는 미세조정 없이도 아키텍처 변경 없이 외부 도메인 검색에서 높은 성능을 유지할 수 있는가?
  • RQ4생성적 및 분류적 훈련 목표의 조합이 검색 성능과 내성에 어떤 영향을 미치는가?
  • RQ5디퓨전 기반 접근 방식이 자동 회귀 또는 GAN 기반 생성 모델보다 검색에 더 확장 가능하고 적응 가능한가?

주요 결과

  • DiffusionRet는 MSRVTT, LSMDC, MSVD, ActivityNet Captions, DiDeMo 등 다섯 가지 표준 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 외부 도메인 검색에서 CLIP4Clip 및 EMCL-Net과 같은 비생성 기반 베이스라인을 능가하며, 뛰어난 제로샷 일반화 능력을 보여준다.
  • 다양한 데이터셋에서 높은 성능을 유지함으로써 강력한 전이 능력과 도메인 이동에 대한 저항력을 나타낸다.
  • 시각화 결과는 도메인 내 및 도메인 외 설정 모두에서 긍정 쌍과 부정 쌍 간의 명확한 분리가 유지됨을 보여준다.
  • 반복적 디퓨전 과정은 점진적으로 연합 분포를 정밀 조정하며, 군집에서 세분화로의 방식으로 텍스트와 비디오 간의 의미적 상관관계를 드러낸다.
  • 프레임워크는 매우 확장 가능하며, 계산 오버헤드를 최소한으로 유지하면서도 디퓨전 스텝 수를 늘림으로써 성능 향상을 이룰 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.