[论文解读] Multimodal Dual Attention Memory for Video Story Question Answering
本文提出多模态双重注意力记忆(MDAM)模型,一种用于视频故事问答的任务,通过双重注意力机制——对视频帧和字幕进行自注意力计算,随后进行问题引导的注意力计算——并结合晚期多模态融合,学习高层联合表征。MDAM在MovieQA(41.41%)和PororoQA(48.9%)上均取得最先进性能,证明了双重注意力与晚期融合在复杂视频理解任务中的有效性。
We propose a video story question-answering (QA) architecture, Multimodal Dual Attention Memory (MDAM). The key idea is to use a dual attention mechanism with late fusion. MDAM uses self-attention to learn the latent concepts in scene frames and captions. Given a question, MDAM uses the second attention over these latent concepts. Multimodal fusion is performed after the dual attention processes (late fusion). Using this processing pipeline, MDAM learns to infer a high-level vision-language joint representation from an abstraction of the full video content. We evaluate MDAM on PororoQA and MovieQA datasets which have large-scale QA annotations on cartoon videos and movies, respectively. For both datasets, MDAM achieves new state-of-the-art results with significant margins compared to the runner-up models. We confirm the best performance of the dual attention mechanism combined with late fusion by ablation studies. We also perform qualitative analysis by visualizing the inference mechanisms of MDAM.
研究动机与目标
- 为解决视频故事问答任务中的挑战,即模型需对时间对齐的多模态内容(帧、字幕、问题)进行高层次抽象推理。
- 克服先前模型直接融合原始视频与字幕特征所导致的过拟合与泛化能力差的问题。
- 探究在多模态融合前学习潜在表征是否能提升推理性能。
- 验证晚期融合(仅在高层次抽象后应用融合)相比早期融合是否能取得更优结果。
提出的方法
- 使用ResNet、GloVe、位置编码和大小写特征,将视频帧与字幕嵌入共享表征空间。
- 应用多头自注意力机制,从帧与字幕的完整序列中学习潜在变量,捕捉高层抽象表征。
- 针对每个问题,应用第二重注意力机制,选择性地关注来自帧与字幕的相关潜在概念。
- 仅在双重注意力之后进行一次多模态融合,利用残差学习将问题、字幕与帧表征进行结合。
- 采用端到端的监督训练流程,包含五个子模块:预处理、自注意力、问题引导注意力、多模态融合与答案选择。
- 采用晚期融合策略以减少过拟合并提升收敛性,与早期融合方法形成对比,后者过早地在时间与模态维度上进行融合。
实验结果
研究问题
- RQ1与直接融合相比,双重注意力机制(先对视频内容进行自注意力,再进行问题引导注意力)是否能提升对视频故事的推理能力?
- RQ2在视频故事问答中,晚期多模态融合(在抽象之后)是否比早期融合(在抽象之前)更有效?
- RQ3对帧与字幕进行自注意力是否有助于学习更鲁棒、更高层次的表征,以支持下游问答任务?
- RQ4该模型的注意力机制在复杂视频叙事中是否与人类推理方式对齐?
- RQ5移除自注意力模块或采用早期融合对整体性能有何影响?
主要发现
- MDAM在MovieQA上取得41.41%的测试准确率,达到最先进水平,领先第二名模型(Layered Memory Networks)2.38个百分点。
- 在PororoQA上,MDAM取得48.9%的准确率,显著优于基线模型,创下新的最先进性能。
- 消融实验表明,若移除自注意力模块,性能下降至47.3%,验证了其在学习高层抽象中的关键作用。
- 采用早期融合的模型(MDAM-EarlyFusion)在PororoQA上仅取得46.1%的准确率,表明晚期融合优于早期融合。
- 定性分析显示,MDAM能根据问题正确关注相关帧与字幕,而无自注意力的消融模型常无法准确定位关键信息。
- 与早期融合基线相比,该模型收敛更快且损失波动更小,表明晚期融合提升了训练稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。