Skip to main content
QUICK REVIEW

[论文解读] Clover: Towards A Unified Video-Language Alignment and Fusion Model

Jingjia Huang, Yinan Li|arXiv (Cornell University)|Jul 16, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

Clover 提出了一种统一的视频-语言预训练模型,通过一种新颖的三模态对齐(TMA)目标,增强了跨模态对齐与融合,该目标关联了视频、文本以及融合的多模态表征。通过引入语义掩码和成对排序损失,Clover 在无需牺牲效率的前提下,在多个检索和视频问答任务中实现了最先进性能,优于特定任务的模型以及简单的模型组合。

ABSTRACT

Building a universal Video-Language model for solving various video understanding tasks (\emph{e.g.}, text-video retrieval, video question answering) is an open challenge to the machine learning field. Towards this goal, most recent works build the model by stacking uni-modal and cross-modal feature encoders and train it with pair-wise contrastive pre-text tasks. Though offering attractive generality, the resulted models have to compromise between efficiency and performance. They mostly adopt different architectures to deal with different downstream tasks. We find this is because the pair-wise training cannot well \emph{align} and \emph{fuse} features from different modalities. We then introduce extbf{Clover} extemdash a Correlated Video-Language pre-training method extemdash towards a universal Video-Language model for solving multiple video understanding tasks with neither performance nor efficiency compromise. It improves cross-modal feature alignment and fusion via a novel tri-modal alignment pre-training task. Additionally, we propose to enhance the tri-modal alignment via incorporating learning from semantic masked samples and a new pair-wise ranking loss. Clover establishes new state-of-the-arts on multiple downstream tasks, including three retrieval tasks for both zero-shot and fine-tuning settings, and eight video question answering tasks. Codes and pre-trained models will be released at \url{https://github.com/LeeYN-43/Clover}.

研究动机与目标

  • 解决现有统一视频-语言模型在检索和 VQA 任务中使用独立架构所导致的效率低下和性能妥协问题。
  • 通过一种新颖的预训练目标,显式关联单模态和多模态编码器的输出,以改善跨模态特征对齐与融合。
  • 在保持大规模检索高效率的同时,实现下游视频理解任务的强性能。
  • 通过在预训练阶段引入语义掩码和成对排序损失,提升模型的泛化能力和判别能力。

提出的方法

  • 提出三模态对齐(TMA),一种预训练任务,通过将多模态表征与视频和文本的单模态表征对齐,以促进相互学习。
  • 采用语义掩码策略生成保留关键语义内容的掩码样本,提升对部分输入的鲁棒性。
  • 引入成对排序损失,以区分掩码样本与原始样本,增强模型对语义差异的敏感度。
  • 以标准掩码语言建模(MLM)作为基础目标,与现有预训练框架兼容,并增加极少的计算开销。
  • 将 TMA 与现有的对比学习和掩码建模目标结合,联合优化对齐与融合。
  • 采用共享编码器架构,配备独立的视频和文本单模态编码器,以及用于融合的联合多模态编码器。

实验结果

研究问题

  • RQ1统一的视频-语言模型是否能在不牺牲架构的前提下,同时实现检索任务的高效率和视频问答任务的高性能?
  • RQ2通过三模态对齐显式关联单模态和多模态编码器的输出,是否能改善跨模态对齐与融合?
  • RQ3语义掩码和成对排序损失是否能增强模型捕捉视频-文本对中细微语义差异的能力?
  • RQ4与标准对比学习或掩码语言建模预训练相比,所提出的三模态对齐在下游任务中的表现如何?

主要发现

  • Clover 在三种文本-视频检索基准上,无论是在零样本还是微调设置下,均建立了新的最先进结果。
  • 在八个视频问答基准上,Clover 的表现持续优于特定任务模型和简单模型组合(COMB)。
  • 采用三模态对齐的模型相比基线,对正样本视频-文本对的余弦相似度更高,且正负样本对之间的差距更大。
  • 引入语义掩码和成对排序损失带来了可测量的性能提升,尤其在 DiDemo 等复杂数据集(具有多样化描述)上表现显著。
  • 定性结果表明,Clover 生成的描述和答案更准确,例如能正确识别出 'paper airplane' 或 'Lion',而非使用模糊术语。
  • 消融研究证实,仅使用 TMA 即可优于标准对比学习预训练,而包含所有组件的完整 Clover 模型达到最佳性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。