[论文解读] TutorialVQA: Question Answering Dataset for Tutorial Videos
本文提出了TutorialVQA,一个全新的视频问答数据集,包含约6,000个从图像编辑工具教学录屏视频中人工精心筛选的(视频片段,问题,答案范围)三元组。该任务聚焦于将多步骤、非事实性答案定位为视频片段,而非短文本答案,基线结果表现不佳,表明该任务具有挑战性,亟需新模型以实现教学视频中精确的范围定位。
Despite the number of currently available datasets on video question answering, there still remains a need for a dataset involving multi-step and non-factoid answers. Moreover, relying on video transcripts remains an under-explored topic. To adequately address this, We propose a new question answering task on instructional videos, because of their verbose and narrative nature. While previous studies on video question answering have focused on generating a short text as an answer, given a question and video clip, our task aims to identify a span of a video segment as an answer which contains instructional details with various granularities. This work focuses on screencast tutorial videos pertaining to an image editing program. We introduce a dataset, TutorialVQA, consisting of about 6,000manually collected triples of (video, question, answer span). We also provide experimental results with several baselines algorithms using the video transcripts. The results indicate that the task is challenging and call for the investigation of new algorithms.
研究动机与目标
- 填补现有视频问答数据集中缺乏支持非事实性、多步骤问题且需要基于范围回答而非短文本响应的空白。
- 构建一个专注于教学录屏视频的数据集,其中答案分布在多个片段中,需要精细的定位。
- 探索仅使用视频转录文本在长篇教学视频中进行答案范围定位的可行性,此类数据在现有VQA基准中尚未被充分利用。
- 在句子级预测和视频片段检索任务上评估基线模型,揭示范围定位中的重大挑战。
- 通过展示当前模型即使在识别出正确视频的情况下仍难以实现精确的范围定位,激发未来研究。
提出的方法
- 该数据集TutorialVQA由6,000个手工收集的三元组构成,包括视频片段、自然语言问题以及视频中对应的答案范围。
- 答案范围被定义为包含非事实性“如何做”问题完整答案的连续视频片段,粒度可变。
- 基线模型使用TF-IDF向量化方法对视频转录文本、问题和候选片段进行编码,随后通过余弦相似度识别最相关片段。
- 第一个基线模型通过容忍窗口进行句子级预测,以应对范围定位中的微小边界误差。
- 第二个基线模型通过TF-IDF余弦相似度筛选出最相似的前10个视频,然后在每个视频中选择最佳片段进行视频片段检索。
- 第三个基线模型结合视频筛选与片段选择,分别评估整体性能以及在正确视频位于前10名时的条件性能。
实验结果
研究问题
- RQ1现有视频问答模型能否有效在教学录屏视频中将多步骤、非事实性答案定位为范围?
- RQ2仅使用视频转录文本在长篇教学视频中进行基于范围的答案定位有多有效?
- RQ3通过先筛选相关视频来缩小搜索空间,是否能提高片段检索的准确性?
- RQ4为何当前模型即使识别出正确区域,仍无法精确确定答案边界?
- RQ5哪些架构改进(如指针网络)可提升范围边界预测的准确性?
主要发现
- 第一个基线模型(使用容忍窗口进行范围预测)在窗口大小为6时仅达到14.43%的准确率,表明边界定位能力极差。
- 第二个基线模型(执行视频片段检索)在句子级预测任务上的准确率为23.41%,表明其效果有限。
- 当正确视频位于前10名筛选结果中时,片段检索准确率提升至63.85%,表明视频筛选能显著提高性能。
- 错误分析显示,92%的错误预测与真实答案范围重叠,但边界选择不精确,表明需要更优的边界建模方法。
- 通过指针网络,范围预测的搜索空间从n²减少到2n,可能通过聚焦于边界句子而非所有可能的范围来提升准确率。
- 结果表明当前模型在该任务上表现不足,凸显了开发新型架构和融合视觉与文本信号的多模态方法的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。