[论文解读] DramaQA: Character-Centered Video Story Understanding with Hierarchical QA
DramaQA 引入了一个以角色为中心的视频故事理解基准,基于认知发展阶段的分层问题回答(QA)机制,包含四个难度级别的 17,983 对 QA,以及丰富的标注信息,包括视觉边界框、情绪、行为和共指脚本。所提出的多级上下文匹配模型结合了低级和高级表征,以提升对复杂问题的推理能力,在该数据集上实现了最先进性能,尤其在更难的 QA 难度级别上取得了显著提升。
Despite recent progress on computer vision and natural language processing, developing a machine that can understand video story is still hard to achieve due to the intrinsic difficulty of video story. Moreover, researches on how to evaluate the degree of video understanding based on human cognitive process have not progressed as yet. In this paper, we propose a novel video question answering (Video QA) task, DramaQA, for a comprehensive understanding of the video story. The DramaQA focuses on two perspectives: 1) Hierarchical QAs as an evaluation metric based on the cognitive developmental stages of human intelligence. 2) Character-centered video annotations to model local coherence of the story. Our dataset is built upon the TV drama "Another Miss Oh" and it contains 17,983 QA pairs from 23,928 various length video clips, with each QA pair belonging to one of four difficulty levels. We provide 217,308 annotated images with rich character-centered annotations, including visual bounding boxes, behaviors and emotions of main characters, and coreference resolved scripts. Additionally, we suggest Multi-level Context Matching model which hierarchically understands character-centered representations of video to answer questions. We release our dataset and model publicly for research purposes, and we expect our work to provide a new perspective on video story understanding research.
研究动机与目标
- 开发一个全面的视频故事理解基准,以反映人类认知发展阶段。
- 通过基于记忆容量和逻辑复杂度的四个分层难度级别,解决现有视频 QA 数据集中缺乏系统性难度分级的问题。
- 通过详细的视觉和语言标注(包括边界框、情绪、行为和共指脚本)实现以角色为中心的故事连贯性。
- 提出一种多级建模范式,以捕捉低级视觉细节和高级叙事推理,从而提升 QA 性能。
- 公开发布数据集和模型,以推动多模态视频理解与推理研究的发展。
提出的方法
- 数据集基于电视剧《Another Miss Oh》构建,包含 23,928 个视频片段和 17,983 对 QA,每对 QA 根据皮亚杰认知发展阶段被分配至四个难度级别。
- 每对 QA 均关联以角色为中心的标注,包括视觉边界框、情绪状态、行为以及共指脚本,以确保叙事连贯性。
- 多级上下文匹配模型采用两个抽象层级:来自视频帧和脚本的低级表征,以及通过聚合上下文获得的高级表征,以建模长距离依赖关系。
- 模型在两个层级上采用晚期交互机制,将问题上下文与视频、脚本和角色表征进行匹配,实现分层推理。
- 对脚本应用共指消解,以统一对话中对同一角色的提及,提升与视觉标注的一致性。
- 模型采用端到端训练,使用交叉熵损失进行优化,并通过在四个难度级别上的准确率评估推理深度。
实验结果
研究问题
- RQ1如何基于认知发展阶段的分层问题难度体系来评估视频故事理解?
- RQ2以角色为中心的视觉和语言标注在复杂视频 QA 任务中在多大程度上提升了模型性能?
- RQ3结合低级细节与高级叙事上下文的多级表征学习,是否能增强对分层 QA 任务的推理能力?
- RQ4视觉和文本模态在回答不同难度问题时分别发挥怎样的作用?
- RQ5共指消解和以角色为导向的表征对建模长距离故事连贯性有何影响?
主要发现
- 多级上下文匹配模型优于基线模型,尤其在更难的问题(难度 3 和 4)上表现突出,证明高级表征在复杂推理中的有效性。
- 当移除高级表征时,性能显著下降,表明其在处理复杂叙事推理中的关键作用。
- 模型显示,仅使用视觉输入在简单问题(难度 1 和 2)上表现良好,但在视觉细节模糊或缺失时表现困难。
- 从视觉输入中移除角色元数据(边界框、情绪、行为)会导致性能急剧下降,证明以角色为中心的标注至关重要。
- 脚本中的共指消解显著提升了性能,因为缺乏该机制的模型无法正确将问题中的提及与对应角色关联。
- 完整模型(Our(Full))在所有难度级别上均取得最高准确率,尤其在难度 3 和 4 上提升显著,证实了多级、以角色为导向推理的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。