Skip to main content
QUICK REVIEW

[论文解读] TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment

Jianwei Yang, Yonatan Bisk|arXiv (Cornell University)|Aug 23, 2021
Multimodal Machine Learning Applications参考文献 53被引用 4
一句话总结

TACo 提出了一种基于标记感知的级联对比学习方法,通过语法感知的对比损失聚焦于内容词(名词、动词)并采用级联采样策略,高效地选择困难负样本,从而提升视频-文本对齐效果。该方法在三个文本-视频检索基准(YouCook2、MSR-VTT 和 ActivityNet)上实现了最先进性能,且未增加参数量。

ABSTRACT

Contrastive learning has been widely used to train transformer-based vision-language models for video-text alignment and multi-modal representation learning. This paper presents a new algorithm called Token-Aware Cascade contrastive learning (TACo) that improves contrastive learning using two novel techniques. The first is the token-aware contrastive loss which is computed by taking into account the syntactic classes of words. This is motivated by the observation that for a video-text pair, the content words in the text, such as nouns and verbs, are more likely to be aligned with the visual contents in the video than the function words. Second, a cascade sampling method is applied to generate a small set of hard negative examples for efficient loss estimation for multi-modal fusion layers. To validate the effectiveness of TACo, in our experiments we finetune pretrained models for a set of downstream tasks including text-video retrieval (YouCook2, MSR-VTT and ActivityNet), video action step localization (CrossTask), video action segmentation (COIN). The results show that our models attain consistent improvements across different experimental settings over previous methods, setting new state-of-the-art on three public text-video retrieval benchmarks of YouCook2, MSR-VTT and ActivityNet.

研究动机与目标

  • 为解决对比学习在视频-文本任务中缺乏细粒度对齐的问题,即功能词与内容词被同等对待。
  • 通过结构化方式选择困难负样本,提升多模态融合过程中对比损失估计的效率与效果。
  • 通过利用句法类别信息的两阶段对比学习流水线,增强视频-文本对齐。
  • 证明所提方法在下游任务(如检索、动作步骤定位与动作分割)中具有良好的泛化能力。
  • 与先前方法相比,采用更简单、参数高效的对比学习框架,在性能上达到最先进水平。

提出的方法

  • 提出一种标记感知的对比损失,仅基于其句法类别在内容词(如名词、动词)上计算相似度,以提升细粒度定位能力。
  • 采用级联采样方法,利用早期损失(L1 和 L2)的对齐分数,为最终对比损失选择一小部分困难负样本。
  • 按顺序使用三种对比损失:句子级损失(L1)、内容词上的标记级损失(L2),以及在困难负样本上的最终句子级损失(L3)。
  • 采用多阶段训练流程,将 L1 和 L2 的对齐分数在线用于引导 L3 的困难负样本选择,从而降低计算成本。
  • 保持标准的基于 Transformer 的视频-语言模型架构,但通过引入句法感知的对比学习目标与结构化采样策略进行增强。
  • 在 Howto100M 上进行预训练,并在下游数据集上使用标准评估协议进行微调,涵盖检索、定位与分割任务。

实验结果

研究问题

  • RQ1在对比学习目标中聚焦内容词(名词、动词)是否能相比将所有词同等对待,提升视频-文本对齐效果?
  • RQ2基于早期对齐分数的级联采样方法是否比随机采样更高效地提升多模态融合层的学习效果?
  • RQ3一个无额外参数的更简单对比学习流水线是否能在视频-文本检索任务中超越复杂的多损失框架?
  • RQ4TACo 学习到的表征在多大程度上可迁移至下游任务(如动作步骤定位与动作分割)?
  • RQ5在具有不同领域差距的多样化基准上,TACo 的性能与最先进方法相比如何?

主要发现

  • TACo 在三个文本-视频检索基准上实现最先进性能:YouCook2(R1@1: 86.3%)、MSR-VTT(R1@1: 55.7%)和 ActivityNet(R1@1: 72.4%),优于先前方法。
  • 在 YouCook2 上,TACo 相较于之前最先进方法在 Recall@1 上实现 2.1% 的绝对提升,展现出强大的零样本泛化能力。
  • 微调后,TACo 在 MSR-VTT 上达到 58.2% 的 Recall@1,在 ActivityNet 上达到 73.1%,即使存在领域偏移也表现强劲。
  • 在 CrossTask 数据集上的动作步骤定位任务中,TACo 超越 UniVL,平均召回率高出 1.2%,表明其具备更优的跨模态对齐能力。
  • 在 COIN 数据集上的动作分割任务中,TACo 实现 78.9% 的平均 F1 分数,优于 MIL-NCE 并与 UniVL 持平,展现出强大的视频表征学习能力。
  • 消融实验表明,结合标记感知损失与级联采样可获得最佳性能,且两者对最终性能提升均有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。