Skip to main content
QUICK REVIEW

[论文解读] VATEX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research

Xin Wang, Jiawei Wu|arXiv (Cornell University)|Apr 6, 2019
Multimodal Machine Learning Applications参考文献 74被引用 39
一句话总结

VaTeX 引入了一个大型的多语言视频描述数据集(英语与中文)及并行翻译,并提出多语言视频字幕和视频引导的机器翻译任务,表明多语言模型有效且视频上下文有助于翻译。

ABSTRACT

We present a new large-scale multilingual video description dataset, VATEX, which contains over 41,250 videos and 825,000 captions in both English and Chinese. Among the captions, there are over 206,000 English-Chinese parallel translation pairs. Compared to the widely-used MSR-VTT dataset, VATEX is multilingual, larger, linguistically complex, and more diverse in terms of both video and natural language descriptions. We also introduce two tasks for video-and-language research based on VATEX: (1) Multilingual Video Captioning, aimed at describing a video in various languages with a compact unified captioning model, and (2) Video-guided Machine Translation, to translate a source language description into the target language using the video information as additional spatiotemporal context. Extensive experiments on the VATEX dataset show that, first, the unified multilingual model can not only produce both English and Chinese descriptions for a video more efficiently, but also offer improved performance over the monolingual models. Furthermore, we demonstrate that the spatiotemporal video context can be effectively utilized to align source and target languages and thus assist machine translation. In the end, we discuss the potentials of using VATEX for other video-and-language research.

研究动机与目标

  • 提供一个大规模、面向视频字幕与翻译的多语言基准。
  • 通过将英文和中文字幕与多样化视频配对,促进多语言研究。
  • 研究一个紧凑的多语言模型是否能更高效、有效地用多种语言描述视频。
  • 探索使用视频上下文提升跨语言机器翻译的潜力。

提出的方法

  • 使用41,269个有效视频片段、825k字幕(英文和中文),其中包括206k对英文-中文平行对。
  • 对每个视频注释10条英文和10条中文字幕,译文通过后编辑获得以确保与视频内容对齐。
  • 提出三种多语言字幕模型变体:两种单语基线、Shared Enc(共享视频编码器、语言解码器)和Shared Enc-Dec(共享编码器和解码器,带语言特定的词嵌入)。
  • 采用基于注意力的编码器-解码器框架进行字幕生成,使用3D ConvNet(I3D)特征和带点积注意力的双向LSTM编码器。
  • 引入Video-Guided Machine Translation(VMT),使用具有文本和时空视频上下文及双重注意力(源文本和视频)的多模态序列到序列模型。
  • 使用BLEU-4、METEOR、ROUGE-L和CIDEr在VaTeX-English和VaTeX-Chinese上评估模型。

实验结果

研究问题

  • RQ1相对于单语模型,多语言训练是否提升视频字幕质量?
  • RQ2一个紧凑的统一多语言模型能否通过共享编码器/嵌入有效地用英文和中文描述视频?
  • RQ3纳入时空视频上下文是否改善英文与中文之间的机器翻译(Video-Guided Machine Translation)?
  • RQ4视频上下文在跨语言翻译时如何帮助还原名词和动词?
  • RQ5与MSR-VTT等现有数据集相比,VaTeX字幕的词汇和多样性特征是什么?

主要发现

  • VaTeX 更大且多语言,拥有41.3k个视频和825k条字幕(英文和中文),其中包括206k对英文–中文翻译对。
  • 多语言模型(Shared Enc 与 Shared Enc-Dec)在BLEU-4、METEOR、ROUGE-L、CIDEr上持续优于单语基线,同时显著减少参数量(Shared Enc −4.7M,Shared Enc-Dec −13.4M)。
  • 视频上下文提升翻译性能:VMT(带时序注意力的LSTM视频特征)在强基线基础上BLEU-4分别提升+2.27(英语到中文)和+2.11(中文到英语)。
  • 名词/动词 masking 实验表明,随着 masking 增加,VMT 在恢复缺失 lexical items 方面优于 NMT,显示视频信息有助于消歧义和对齐。
  • VaTeX 字幕比 MSR-VTT 更长、词汇更丰富且重复度更低(同一视频内无重复),英文与中文的名词/动词使用也更丰富。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。