[论文解读] Learning Video Representations from Textual Web Supervision
本文提出利用YouTube元数据(如标题、描述、标签和频道名称)中的文本网络监督信号,无需人工标注即可预训练视频表征。通过基于文本搜索收集7000万对视频-文本数据,并训练3D卷积神经网络使视频与文本嵌入对齐,该方法在动作识别基准上达到最先进性能,优于所有先前的自监督和跨模态方法,在HMDB-51上提升8.9%,在UCF-101上提升2.1%。
Videos on the Internet are paired with pieces of text, such as titles and descriptions. This text typically describes the most important content in the video, such as the objects in the scene and the actions being performed. Based on this observation, we propose to use text as a method for learning video representations. To accomplish this, we propose a data collection process and use it to collect 70M video clips shared publicly on the Internet, and we then train a model to pair each video with its associated text. We evaluate the model on several down-stream action recognition tasks, including Kinetics, HMDB-51, and UCF-101. We find that this approach is an effective method of pre-training video representations. Specifically, it outperforms all existing methods for self-supervised and cross-modal video representation learning.
研究动机与目标
- 为解决完全监督视频表征学习中成本高昂且收益递减的问题,利用公开视频中免费获取的文本元数据。
- 探究YouTube中非结构化、开放式文本(如标题、描述)是否可作为视频表征学习的可扩展且有效的监督信号。
- 开发一种可扩展的数据收集管道,从网络自动获取大规模视频-文本对,无需人工标注。
- 评估此类弱监督表征在下游动作识别任务中的泛化能力,特别是在低数据场景下的表现。
- 研究文本网络监督与完全监督预训练之间的互补性,证明二者结合可产生协同增益。
提出的方法
- 提出一种弱文本监督(WTS)数据收集流程,利用基于文本的视频搜索,收集7000万对视频片段及其对应的标题、描述、标签和频道名称。
- 采用3D卷积神经网络(3D CNN)架构,通过对比学习使视频表征与对应文本嵌入对齐。
- 在WTS-70M数据集上端到端训练视频-文本匹配模型,使用对比损失最大化匹配视频-文本对之间的一致性。
- 通过微调和冻结主干网络的方式,在下游动作识别数据集(Kinetics、HMDB-51、UCF-101)上评估学习到的表征。
- 发布完整的7000万对视频-文本对数据集及预训练模型,以支持可复现性与未来研究。
- 进行消融研究,分析各文本模态(如标题与描述)的独立贡献及其组合对性能的影响。
实验结果
研究问题
- RQ1公开分享的YouTube视频中的文本元数据能否作为无人工标注的视频表征预训练中可扩展且有效的监督信号?
- RQ2在标准动作识别基准上,基于网络监督文本预训练的视频表征性能与现有自监督和跨模态方法相比如何?
- RQ3在低数据场景下(如每类仅少数标注样本),该方法的泛化能力如何,例如在平均每类仅6.5个样本时?
- RQ4能否有效结合网络监督预训练与完全监督预训练,以进一步提升下游性能?
- RQ5哪些文本组件(如标题、描述、标签)对学习到的视频表征质量贡献最大?
主要发现
- 所提方法在HMDB-51上达到最先进性能,相比先前方法准确率提升8.9%;在UCF-101上提升2.1%。
- 在Kinetics-400和Kinetics-600上,使用冻结特征时分别达到72.7%和75.5%的准确率,优于CVRL及其他基线方法。
- 在极端低数据场景下(如平均每类仅6.5个样本),WTS-70M预训练在Kinetics-600上1%标签比例下达到40.9%准确率,优于CVRL和从零开始训练。
- 当与Kinetics-700预训练结合时,WTS-70M使HMDB-51准确率相比仅使用Kinetics-700提升8.5%,证明其与完全监督学习具有强互补性。
- 该方法优于所有现有自监督和跨模态视频表征学习方法,包括使用音频或视频预测的方法。
- 标题和描述单独即可提供强监督信号,二者结合性能最佳,凸显开放式、描述性文本相较于固定类别标签的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。