[论文解读] CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning
CUPID 提出了一种自适应数据筛选框架,通过筛选与目标领域相关的视频数据来聚焦预训练数据,从而缩小视频-语言表示学习中的领域差距。通过选择在视觉和语义上与下游任务相似的源视频,CUPID 在文本到视频检索、视频问答和视频字幕生成任务上实现了最先进性能,相比完整预训练,数据量减少高达80%,训练步数减少60%。
This work concerns video-language pre-training and representation learning. In this now ubiquitous training scheme, a model first performs pre-training on paired videos and text (e.g., video clips and accompanied subtitles) from a large uncurated source corpus, before transferring to specific downstream tasks. This two-stage training process inevitably raises questions about the generalization ability of the pre-trained model, which is particularly pronounced when a salient domain gap exists between source and target data (e.g., instructional cooking videos vs. movies). In this paper, we first bring to light the sensitivity of pre-training objectives (contrastive vs. reconstructive) to domain discrepancy. Then, we propose a simple yet effective framework, CUPID, to bridge this domain gap by filtering and adapting source data to the target data, followed by domain-focused pre-training. Comprehensive experiments demonstrate that pre-training on a considerably small subset of domain-focused data can effectively close the source-target domain gap and achieve significant performance gain, compared to random sampling or even exploiting the full pre-training dataset. CUPID yields new state-of-the-art performance across multiple video-language and video tasks, including text-to-video retrieval [72, 37], video question answering [36], and video captioning [72], with consistent performance lift over different pre-training methods.
研究动机与目标
- 探究现有预训练范式是否因源数据与目标数据之间的领域差距而在跨领域迁移时泛化能力差。
- 解决预训练模型迁移到分布外数据时下游任务性能下降的问题。
- 开发一种自适应方法,筛选与目标领域匹配的预训练数据,提升迁移能力,同时避免大规模预训练。
- 证明:在小规模、经筛选的数据子集上进行聚焦预训练,可优于随机采样或在更大未筛选数据集上的完整预训练。
提出的方法
- CUPID 通过基于嵌入的相似性或元数据匹配,识别与目标下游数据集在视觉和语义上相似的源视频,从而从大规模源预训练数据集中筛选出子集。
- 采用三种筛选策略:启发式匹配、嵌入空间中的k近邻,以及利用视频类别、标题等元数据计算的平均相似度得分。
- 使用筛选后的子集,通过对比学习或重建目标对视频-语言模型进行预训练,使学习聚焦于领域相关模式。
- 提出一种新型的N²-NCE损失,通过将负样本集的规模二次扩展,缓解因小批量训练导致的性能下降。
- 该框架支持视频-语言预训练(CUPID-vlp)和仅视频预训练(CUPID-clip),可迁移至多样化的下游任务。
- 在多个基准上进行评估,包括YouCook2、TVQA、TVR和HMDB51,采用标准划分并重新评估基线模型以确保公平比较。
实验结果
研究问题
- RQ1源预训练数据与目标下游数据之间的领域差异在多大程度上影响视频-语言模型的迁移能力?
- RQ2预训练目标的选择(对比学习 vs. 重建学习)是否会影响模型对领域差距的敏感性?
- RQ3一个与目标领域匹配的小规模、经筛选的数据子集,能否优于在更大、未筛选数据集上的完整预训练?
- RQ4自适应数据筛选在多大程度上能提升下游性能,同时减少预训练数据量和训练步数?
主要发现
- 在文本到视频检索任务上,CUPID 实现了新的最先进性能,相比之前最先进方法,R@1 提升27%,R@5 提升19%,R@10 提升17%。
- 在TVR任务上,CUPID 使用仅20%的训练数据和40%的训练步数,相对优于使用完整HowTo100M预训练的最先进模型5%至14%。
- 在TVQA任务上,CUPID 达到74.21%的测试准确率,超过基础模型HERO(73.61%)和最新最先进方法。
- 在YouCook2视频字幕任务上,CUPID-vlp 实现新的最先进性能,尽管使用了HowTo100M预训练的特征提取器,仍大幅超越ActBERT。
- 在HMDB51动作识别任务上,CUPID-clip 的性能与使用更多预训练数据和音频模态的最先进方法相当,证明其在纯视频表示学习中的有效性。
- CUPID 将相同硬件上的预训练时间从三周缩短至六天,同时保持或提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。