[论文解读] Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions
本文提出 HD-VILA,一种基于 371.5K 小时 720p 视频和来自 15 个 YouTube 类别的 100M 个视频-句子对的高分辨率与多样化视频-语言预训练模型。通过使用混合 Transformer 联合编码高分辨率和低分辨率帧,并端到端优化多模态嵌入,HD-VILA 实现了最先进性能,包括在零样本文本到视频检索任务中 R@1 相对提升 40.4%,在高分辨率 LSMDC 上达到 55.4% 的性能提升。
We study joint video and language (VL) pre-training to enable cross-modality learning and benefit plentiful downstream VL tasks. Existing works either extract low-quality video features or learn limited text embedding, while neglecting that high-resolution videos and diversified semantics can significantly improve cross-modality learning. In this paper, we propose a novel High-resolution and Diversified VIdeo-LAnguage pre-training model (HD-VILA) for many visual tasks. In particular, we collect a large dataset with two distinct properties: 1) the first high-resolution dataset including 371.5k hours of 720p videos, and 2) the most diversified dataset covering 15 popular YouTube categories. To enable VL pre-training, we jointly optimize the HD-VILA model by a hybrid Transformer that learns rich spatiotemporal features, and a multimodal Transformer that enforces interactions of the learned video features with diversified texts. Our pre-training model achieves new state-of-the-art results in 10 VL understanding tasks and 2 more novel text-to-visual generation tasks. For example, we outperform SOTA models with relative increases of 40.4% R@1 in zero-shot MSR-VTT text-to-video retrieval task and 55.4% in high-resolution dataset LSMDC. The learned VL embedding is also effective in generating visually pleasing and semantically relevant results in text-to-visual editing and super-resolution tasks.
研究动机与目标
- 解决现有视频-语言预训练模型依赖低质量视频特征和有限文本多样性的问题。
- 通过利用高分辨率(720p)视频和高度多样化的真实世界 YouTube 内容,实现更有效的跨模态学习。
- 开发一种统一框架,以端到端方式联合优化时空视频表征和多模态语言-视频嵌入。
- 通过新数据集和模型,建立高分辨率、大规模且多样化的视频-语言理解新基准。
提出的方法
- 作者收集了 HD-VILA-100M,一个大规模数据集,包含来自 330 万个 720p YouTube 视频的 100M 个视频-句子对,覆盖 15 个不同类别。
- 他们采用混合图像序列策略,从时间上相邻的位置均匀采样低分辨率(LR)帧,同时随机采样高分辨率(HR)帧。
- 混合 Transformer 网络分别编码 HR 和 LR 帧,并将其特征映射到共享嵌入空间,以同时保留空间细节和时间连贯性。
- 该模型采用多模态 Transformer,以端到端方式联合优化视频和语言表征,实现模态间的丰富交叉注意力。
- 该框架支持零样本迁移至下游任务,如文本到视频检索、视频问答和文本到视觉生成。
- 该数据集以视频 URL 和元数据形式发布,遵循开放数据使用协议,由于版权问题未发布原始数据。

实验结果
研究问题
- RQ1与低分辨率基线相比,高分辨率视频输入是否能显著提升视频-语言表征学习?
- RQ2视频内容语义多样性增加是否能提升下游视频-语言任务的泛化能力和性能?
- RQ3端到端联合学习时空视频特征和多模态嵌入是否优于分阶段或双流架构?
- RQ4大规模、多样化且高质量的视频-语言数据集在多大程度上提升零样本和少样本迁移性能?
- RQ5所提出的混合帧编码策略(HR + LR)在保留视觉细节和时间动态方面是否有效?
主要发现
- HD-VILA 在零样本 MSR-VTT 文本到视频检索基准上实现了 R@1 相对提升 40.4%,超越先前最先进模型。
- 在高分辨率 LSMDC 数据集上,HD-VILA 在检索性能上实现 55.4% 的相对提升,表明其对高质量视频输入具有强大泛化能力。
- 该模型在 10 项视频-语言理解任务中均取得最先进结果,包括视频问答和字幕生成。
- 所学习的视频-语言嵌入可实现高质量的文本到视觉编辑和超分辨率,生成语义相关且视觉上合理的输出。
- HD-VILA-100M 数据集包含 371.5K 小时 720p 视频和 15 个多样化类别,是迄今最大且分辨率最高的视频-语言数据集。
- 模型的性能提升归因于高分辨率输入、多样化内容以及端到端多模态优化的结合。
![Figure 2 : The distribution of categories in HD-VILA-100M dataset: (a) video, (b) video clip. [Best viewed in Color]](https://ar5iv.labs.arxiv.org/html/2111.10337/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。