[论文解读] NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions
NExT-QA 引入了一个大规模、人工精心构建的视频问答基准,包含 5,440 个视频和 52K 个问答对,以推动视频理解从描述性理解迈向因果和时间动作推理。尽管在描述性问题上表现强劲,但当前最先进模型在因果和时间推理方面表现显著不足,尤其是在开放型问答任务中,暴露出模型在答案选择之外的理解能力存在根本性差距。
We introduce NExT-QA, a rigorously designed video question answering (VideoQA) benchmark to advance video understanding from describing to explaining the temporal actions. Based on the dataset, we set up multi-choice and open-ended QA tasks targeting causal action reasoning, temporal action reasoning, and common scene comprehension. Through extensive analysis of baselines and established VideoQA techniques, we find that top-performing methods excel at shallow scene descriptions but are weak in causal and temporal action reasoning. Furthermore, the models that are effective on multi-choice QA, when adapted to open-ended QA, still struggle in generalizing the answers. This raises doubt on the ability of these models to reason and highlights possibilities for improvement. With detailed results for different question types and heuristic observations for future works, we hope NExT-QA will guide the next generation of VQA research to go beyond superficial scene description towards a deeper understanding of videos. (The dataset and related resources are available at https://github.com/doc-doc/NExT-QA.git)
研究动机与目标
- 推动视频理解从浅层描述迈向对视频中因果和时间动作的深层解释。
- 解决缺乏严格评估真实世界视频内容中因果和时间推理能力的基准问题。
- 通过引入针对表面识别之外推理能力的多选题和开放型问答任务,挑战现有 VideoQA 模型。
- 提供一种诊断工具,用于评估模型在复杂视频理解中的泛化能力和推理能力。
- 引导未来研究构建真正理解动作序列及其潜在原因的模型。
提出的方法
- 该基准基于来自 VidOR 的 5,440 个真实世界视频构建,人工标注了问答对,并按因果、时间与描述性三类进行分组。
- 定义了两种任务类型:包含五个候选答案的多选题问答,以及需要根据视频和问题线索生成自由形式答案的开放型问答。
- 在当前最先进 VideoQA 模型(包括 HGA、EVQA、PSAC+ 和 STVQA)上,对两种任务类型进行了全面评估。
- 多选题问答使用准确率进行评估,开放型问答使用 WUPS 分数评估生成答案的语义相似度。
- 视觉特征通过外观编码器和运动编码器提取,文本表示则使用 BERT 和 GloVe 进行语言建模。
- 探索基于图的模型(如 HGA),以显式建模动作与对象之间的时序和因果关系。
实验结果
研究问题
- RQ1当前最先进 VideoQA 模型能否在描述性问题之外,泛化到对视频动作中因果和时间关系的推理?
- RQ2多选题与开放型问答任务在暴露模型推理与语言生成能力局限性方面有何不同?
- RQ3与词嵌入(如 GloVe)相比,预训练语言模型(如 BERT)在因果和时间问题推理中有多大提升?
- RQ4为何在多选题问答中表现良好的模型在开放型问答中表现不佳?这对其推理能力意味着什么?
- RQ5视觉特征融合策略(外观与运动)在因果和时间推理任务中的表现有何影响?
主要发现
- 表现最佳的 VideoQA 模型在描述性问题(如物体和动作识别)上取得优异结果,但在因果和时间多选题上的性能差距达到 10%。
- 在开放型问答中,因果和时间问题的性能差距扩大至约 30%,表明在推理与生成方面存在严重局限。
- 基于图的模型(如 HGA)在因果和时间推理任务中表现更优,表明其在建模视频中关系结构方面具有价值。
- 尽管 BERT 倾向于文本问答任务,其预训练表示在推理任务中仍优于 GloVe,尤其在因果和时间问题上表现更佳。
- 在多选题问答中训练的模型在开放型问答中表现显著下降,表明其可能依赖于答案选择而非基于视觉的推理或语言生成。
- 在长问题和长答案上无法生成连贯准确答案,凸显了语言理解与生成能力的缺陷,即使在有视觉特征支持的情况下也难以克服。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。