Skip to main content
QUICK REVIEW

[论文解读] MDMMT-2: Multidomain Multimodal Transformer for Video Retrieval, One More Step Towards Generalization

Alexander Kunitsyn, Maksim Kalashnikov|arXiv (Cornell University)|Mar 14, 2022
Advanced Image and Video Retrieval Techniques被引用 7
一句话总结

该论文提出 MDMMT-2,一种单一统一的多模态 Transformer 模型,通过结合弱监督、图文和文本-视频数据集,采用三阶段训练流程、双位置编码和使用预训练 CLIP 与视频主干模型的高效迁移学习,实现了在五个不同文本到视频检索基准(MSR-VTT、LSMDC、MSVD、YouCook2 和 TGIF)上的最先进性能。

ABSTRACT

In this work we present a new State-of-The-Art on the text-to-video retrieval task on MSR-VTT, LSMDC, MSVD, YouCook2 and TGIF obtained by a single model. Three different data sources are combined: weakly-supervised videos, crowd-labeled text-image pairs and text-video pairs. A careful analysis of available pre-trained networks helps to choose the best prior-knowledge ones. We introduce three-stage training procedure that provides high transfer knowledge efficiency and allows to use noisy datasets during training without prior knowledge degradation. Additionally, double positional encoding is used for better fusion of different modalities and a simple method for non-square inputs processing is suggested.

研究动机与目标

  • 开发一种通用的文本到视频检索模型,无需领域特定微调即可在多样化领域中表现良好。
  • 通过在训练过程中结合弱监督、图文和文本-视频数据集,提升模型泛化能力。
  • 在噪声大、多样化的数据源上训练时,防止过拟合和知识退化。
  • 通过双位置编码和对非正方形视频输入的稳健处理,增强跨模态融合。
  • 使用单一统一的模型架构,在多个基准上实现最先进结果。

提出的方法

  • 结合三种数据源:弱监督视频(HT100M)、众包标注的图文对以及文本-视频对,以增加训练数据的多样性与规模。
  • 采用三阶段训练流程,避免对预训练主干网络进行微调,从而保留其泛化能力并防止领域特定过拟合。
  • 引入双位置编码,以更好地对齐和融合 Transformer 编码器中视觉、运动、音频和文本模态的表征。
  • 基于对先验知识的经验分析,选择 CLIP 和 irCSN152-IG65M 作为预训练视觉和文本编码器,以实现最佳性能。
  • 采用一种简单而有效的方法处理非正方形视频输入,确保对不同宽高比的鲁棒性,且无需修改网络架构。
  • 利用对比学习结合对称交叉熵损失和余弦相似度进行跨模态匹配,支持对未见查询的零样本泛化。

实验结果

研究问题

  • RQ1单一统一模型是否能在无需领域特定适配的情况下,在多个多样化文本到视频检索基准上实现最先进性能?
  • RQ2结合弱监督、图文和文本-视频数据集对模型泛化能力和零样本检索性能有何影响?
  • RQ3在不微调预训练主干网络的前提下,三阶段训练流程是否能防止知识退化并提升迁移效率?
  • RQ4双位置编码在多模态视频检索中在多大程度上提升了跨模态融合?
  • RQ5在多样化数据源上训练的单一模型是否能超越在单个基准上专门优化的模型?

主要发现

  • MDMMT-2 在 MSR-VTT 上取得新最先进结果,R@1: 33.4±0.1,R@5: 60.1±0.1,R@10: 70.5±0.1,MnR: 39.2±0.2,MdR: 3.0±0.0。
  • 在 LSMDC 上,MDMMT-2 实现 R@1: 26.9±0.6,R@5: 46.7±0.5,R@10: 55.9±0.4,MnR: 48.0±0.5,MdR: 6.7±0.5,超越先前方法(包括 CLIP4Clip 和 CAMoE)。
  • 在 MSVD 上,MDMMT-2 实现 R@1: 56.8±0.2,R@5: 83.1±0.2,R@10: 89.2±0.1,MnR: 8.8±0.0,MdR: 1.0±0.0,显著优于 CLIP2Video 和 QB-Norm+CLIP2Video。
  • 在 YouCook2 上,MDMMT-2 实现 R@1: 32.0±0.7,R@5: 64.0±0.3,R@10: 74.8±0.2,MnR: 12.7±0.3,MdR: 3.0±0.0,优于 UniVL 和 TACo。
  • 在 TGIF 上,MDMMT-2 实现 R@1: 25.5±0.1,R@5: 46.1±0.0,R@10: 55.7±0.1,MnR: 94.1±0.3,MdR: 7.0±0.0,展现出在短时、多样化视频片段上的强大性能。
  • 该模型在不同领域间泛化效果良好,仅通过一次训练即可在全部五个基准上达到最先进性能,证明了多源数据和三阶段训练策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。