Skip to main content
QUICK REVIEW

[论文解读] VIOLIN: A Large-Scale Dataset for Video-and-Language Inference

Jingzhou Liu, Wenhu Chen|arXiv (Cornell University)|Mar 25, 2020
Multimodal Machine Learning Applications参考文献 70被引用 9
一句话总结

本文介绍了 VIOLIN,一个大规模数据集,包含 95,322 个视频-假设对,涵盖来自电视剧和电影片段的 582 小时视频,专为视频与语言推理任务而设计——该任务要求模型判断一个假设是否被带有字幕的视频所蕴含或矛盾。该数据集通过对抗性生成和人工标注的负面陈述强调深层次的多模态推理,基线模型在对抗性采样的负面样本上仅达到 67.6% 的准确率,凸显了相较于人类表现(85.2%)仍有巨大提升空间。

ABSTRACT

We introduce a new task, Video-and-Language Inference, for joint multimodal understanding of video and text. Given a video clip with aligned subtitles as premise, paired with a natural language hypothesis based on the video content, a model needs to infer whether the hypothesis is entailed or contradicted by the given video clip. A new large-scale dataset, named Violin (VIdeO-and-Language INference), is introduced for this task, which consists of 95,322 video-hypothesis pairs from 15,887 video clips, spanning over 582 hours of video. These video clips contain rich content with diverse temporal dynamics, event shifts, and people interactions, collected from two sources: (i) popular TV shows, and (ii) movie clips from YouTube channels. In order to address our new multimodal inference task, a model is required to possess sophisticated reasoning skills, from surface-level grounding (e.g., identifying objects and characters in the video) to in-depth commonsense reasoning (e.g., inferring causal relations of events in the video). We present a detailed analysis of the dataset and an extensive evaluation over many strong baselines, providing valuable insights on the challenges of this new task.

研究动机与目标

  • 为解决现有视频与语言联合理解基准在静态图像之外的大型、高挑战性数据集缺乏的问题。
  • 提出一项新任务——视频与语言推理,要求模型推断带有字幕的视频与自然语言假设之间的蕴含或矛盾关系。
  • 通过双重视觉标注策略,收集具有丰富时间动态、社会互动和复杂推理需求的多样化、高质量数据集。
  • 在该新基准上评估最先进模型,识别视频与文本多模态推理中的关键挑战。
  • 为推进视频理解任务中的多模态表征学习与推理提供基础。

提出的方法

  • 从电视剧和 YouTube 电影频道收集了 15,887 个视频片段,每个片段均配有对齐的字幕和 6 个假设(3 个正样本,3 个负样本)。
  • 采用两种负面陈述收集策略:(i) 对正样本进行最小编辑修改,以保持风格和长度一致;(ii) 通过对抗性匹配,从其他视频中选取具有迷惑性的陈述。
  • 使用 BERT 获取上下文化的文本表征,视觉特征则来自 ResNet 和 Faster R-CNN(用于目标检测和区域特征)。
  • 评估多种模型,包括 BERT、LXMERT 和多模态编码器,并对输入模态组合(文本、视频、字幕)进行消融实验。
  • 对预测错误进行定性分析,以识别失败模式,尤其关注因果推理和人际关系推理方面的困难。
  • 通过人工评估不同输入组合对推理性能的贡献,以衡量视频、字幕和文本的相对影响。

实验结果

研究问题

  • RQ1现有多模态模型在具有复杂推理需求的大规模、多样化视频数据集上进行视频与语言推理时,效果如何?
  • RQ2对抗性标注与人工标注的负面陈述在难度上有多大差异?它们如何挑战模型的泛化能力?
  • RQ3在视频与语言理解任务中,视频、字幕或文本哪种子模态对推理准确率贡献最大?
  • RQ4当前模型在哪些类型的推理任务(如视觉识别、动作识别、因果推理)上表现最弱?
  • RQ5不同特征表示(如 BERT 与 GloVe、来自 Visual Genome 的视觉特征)对 VIOLIN 基准上模型性能有何影响?

主要发现

  • 最佳基线模型(BERT + 视觉特征)在对抗性采样的负面样本上达到 67.60% 的准确率,显著低于人类表现(85.20%)。
  • 与仅使用文本的输入相比,加入视频输入使准确率提升了 13.01 个百分点(77.19% vs. 51.38%),表明视觉上下文具有关键作用。
  • 当引入视频特征时,模型在‘视觉识别’和‘动作识别’任务上获得最大性能提升,但在‘对话推理’和‘人类动态’任务上提升最小。
  • 对抗性采样的负面样本比人工编写的更难,模型在对抗性负样本上准确率为 67.60%,在人工负样本上为 66.05%,表明其对推理能力要求更高。
  • 模型在‘推断原因’和‘人际关系’任务上表现最差,仅使用视觉特征时准确率降至 50.00%,表明其在因果推理和社会推理方面存在局限。
  • 人工评估确认,视频提供的性能增益高于字幕,表明视觉信号在此任务中比文本描述更具信息量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。