Skip to main content
QUICK REVIEW

[論文レビュー] DiffusionRet: Generative Text-Video Retrieval with Diffusion Model

Peng Jin, Hao Li|arXiv (Cornell University)|Mar 17, 2023
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

DiffusionRetは、生成的diffusionモデルを用いて共通確率分布$p(\text{候補}, \text{クエリ})$をモデル化する、新しい生成的テキスト・ビデオ検索フレームワークを提案する。これにより、高い検索精度に加え、ドメイン外データへの強力な一般化性能が達成される。生成損失と対照的学習を組み合わせることで、5つのベンチマークで最先端の性能を達成するとともに、優れたゼロショット転送性を示す。

ABSTRACT

Existing text-video retrieval solutions are, in essence, discriminant models focused on maximizing the conditional likelihood, i.e., p(candidates|query). While straightforward, this de facto paradigm overlooks the underlying data distribution p(query), which makes it challenging to identify out-of-distribution data. To address this limitation, we creatively tackle this task from a generative viewpoint and model the correlation between the text and the video as their joint probability p(candidates,query). This is accomplished through a diffusion-based text-video retrieval framework (DiffusionRet), which models the retrieval task as a process of gradually generating joint distribution from noise. During training, DiffusionRet is optimized from both the generation and discrimination perspectives, with the generator being optimized by generation loss and the feature extractor trained with contrastive loss. In this way, DiffusionRet cleverly leverages the strengths of both generative and discriminative methods. Extensive experiments on five commonly used text-video retrieval benchmarks, including MSRVTT, LSMDC, MSVD, ActivityNet Captions, and DiDeMo, with superior performances, justify the efficacy of our method. More encouragingly, without any modification, DiffusionRet even performs well in out-domain retrieval settings. We believe this work brings fundamental insights into the related fields. Code is available at https://github.com/jpthu17/DiffusionRet.

研究の動機と目的

  • 判別的モデルのテキスト・ビデオ検索における限界、すなわち元のデータ分布$p(\text{クエリ})$をモデル化できないこと、ドメイン外データへの一般化性能が低いことに対処すること。
  • テキスト・ビデオ検索の生成的アプローチを検討し、共通分布$p(\text{候補}, \text{クエリ})$を捉えることで、一般化性能と転送性を向上させること。
  • diffusionモデルの粗くから細かく、段階的な改善の性質を活用し、テキストとビデオ間の相関を段階的に学習すること。
  • アーキテクチャの変更なしに、ドメイン内およびドメイン外の両設定で高い性能を維持する検索フレームワークを開発すること。
  • 生成的モデリングが、クロスモodal検索において、精度と一般化性能の両面で判別的手法を上回ることを示すこと。

提案手法

  • フレームワークは、ノイズから段階的に共通確率分布$p(\text{候補}, \text{クエリ})$を生成するdiffusionプロセスとしてテキスト・ビデオ検索を定式化する。
  • denoising U-Netアーキテクチャを備えたdiffusionモデルを用い、共通分布表現を段階的に改善する。
  • 生成品質の向上を目的に、Kullback-Leibler発散損失を用いて生成器を最適化する。
  • 特徴抽出器は、対照的損失(InfoNCE)と併用して共同学習され、判別的表現学習を強化する。
  • 生成的および判別的目的を組み合わせ、共通分布モデリングと特徴の整合性のバランスを取る。
  • 効率性とスケーラビリティを向上させるために、特徴抽出にヴァニラTransformerエンコーダーを用いる。

実験結果

リサーチクエスチョン

  • RQ1条件付き分布$p(\text{候補}|\text{クエリ})$ではなく、共通確率分布$p(\text{候補}, \text{クエリ})$をモデル化することで、テキスト・ビデオ検索における一般化性能が向上するか?
  • RQ2diffusionモデルの粗くから細かく、段階的な改善プロセスが、検索タスクにおけるクロスモーダル相関学習を強化するか?
  • RQ3DiffusionRetのような生成的フレームワークは、ファインチューニングやアーキテクチャ変更なしに、ドメイン外検索でも高い性能を維持できるか?
  • RQ4生成的および判別的学習目的の組み合わせが、検索性能と耐障害性にどのように影響を与えるか?
  • RQ5生成的アプローチとしてのdiffusionベースのアプローチは、自己回帰的またはGANベースの生成モデルに比べ、スケーラビリティと適応性に優れているか?

主な発見

  • DiffusionRetは、MSRVTT、LSMDC、MSVD、ActivityNet Captions、DiDeMoの5つの標準ベンチマークで最先端の性能を達成した。
  • ドメイン外検索において、CLIP4Clip や EMCL-Net といった判別的ベースラインを上回り、優れたゼロショット一般化性能を示した。
  • 多様なデータセットにわたり高い性能を維持しており、ドメインシフトに対して強い転送性と耐障害性を示している。
  • 可視化結果から、ドメイン内およびドメイン外の両設定において、正例ペアと負例ペアの明確な分離が維持されていることが確認された。
  • 段階的なdiffusionプロセスは、共通分布を段階的に改善し、粗くから細かく、テキストとビデオ間の意味的相関を明らかにした。
  • フレームワークは非常にスケーラブルであり、計算コストの増加を最小限に抑えながら、diffusionステップ数を増やすことで性能向上が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。