Skip to main content
QUICK REVIEW

[论文解读] Progressive Attention Memory Network for Movie Story Question Answering

Junyeong Kim, Minuk Ma|arXiv (Cornell University)|Apr 18, 2019
Multimodal Machine Learning Applications参考文献 33被引用 13
一句话总结

本文提出了一种新型的渐进式注意力记忆网络(PAMN),用于电影故事问答任务,通过渐进式注意力、动态模态融合和信念修正,解决了长序列时间定位与模态融合的挑战。PAMN 通过在视频和字幕记忆中迭代优化注意力,并根据问题上下文自适应地加权模态,实现了 MovieQA 和 TVQA 基准上的最先进性能。

ABSTRACT

This paper proposes the progressive attention memory network (PAMN) for movie story question answering (QA). Movie story QA is challenging compared to VQA in two aspects: (1) pinpointing the temporal parts relevant to answer the question is difficult as the movies are typically longer than an hour, (2) it has both video and subtitle where different questions require different modality to infer the answer. To overcome these challenges, PAMN involves three main features: (1) progressive attention mechanism that utilizes cues from both question and answer to progressively prune out irrelevant temporal parts in memory, (2) dynamic modality fusion that adaptively determines the contribution of each modality for answering the current question, and (3) belief correction answering scheme that successively corrects the prediction score on each candidate answer. Experiments on publicly available benchmark datasets, MovieQA and TVQA, demonstrate that each feature contributes to our movie story QA architecture, PAMN, and improves performance to achieve the state-of-the-art result. Qualitative analysis by visualizing the inference mechanism of PAMN is also provided.

研究动机与目标

  • 解决在长时电影视频(通常超过一小时)中精确定位相关时间片段以支持问答的挑战。
  • 根据问题的具体需求,实现视频与字幕模态的自适应融合,因为不同问题依赖于不同的模态。
  • 通过逐步修正答案预测来建模类人迭代推理过程,实现答案预测的逐步优化。
  • 通过整合渐进式注意力、动态模态融合与迭代信念优化,提升电影故事问答基准的表现。

提出的方法

  • 渐进式注意力机制利用问题和答案表征,通过多跳迭代逐步剔除记忆中不相关的时间片段,实现注意力的逐步优化。
  • 动态模态融合采用软注意力机制,根据当前问题自适应地加权视频与字幕特征,实现模态特异性贡献,无需固定融合规则。
  • 信念修正问答机制初始时均匀设置预测得分,并通过问题和答案线索逐步修正,模拟人类的迭代推理过程。
  • 该模型使用记忆网络,在视频与字幕特征上应用时间注意力机制,通过条件于问题和答案表征的多轮注意力更新实现记忆更新。
  • 采用具有可学习步长与卷积核大小的平均池化层对记忆特征进行下采样,以在分辨率与计算成本之间取得平衡。
  • 信念模块中的修正权重通过学习获得,用于调节问题与答案表征对信念更新的影响,并在各步骤间应用归一化。

实验结果

研究问题

  • RQ1如何使问答模型在信息分布不均的长电影视频中有效定位相关的时间片段?
  • RQ2模态融合在多大程度上可实现对问题类型的自适应,使视频或字幕模态根据问题需求贡献更多?
  • RQ3与单步生成答案相比,通过迭代优化答案预测(即信念修正)是否能提升问答性能?
  • RQ4与单步或堆叠注意力机制相比,使用问题和答案共同引导记忆访问的渐进式注意力机制在长视频问答中的表现如何?

主要发现

  • PAMN 在 MovieQA 基准上实现了最先进性能,优于 MemN2N 和 RWMN 等先前方法。
  • 模型在 'when' 问题上性能提升 20%,在 'where' 问题上提升 13%,表明其在时间定位方面具有强大能力。
  • 定性分析表明,渐进式注意力映射与问题生成时的真实时间片段高度吻合。
  • 动态模态融合能根据问题类型自适应选择视频或字幕模态,注意力权重反映出模态的相关性,且无需监督。
  • 信念修正机制成功在多步中优化预测,正确答案通常在后期修正阶段被选中。
  • 超参数消融实验表明,两次注意力跳跃(2 次重复)达到最优性能,而过多跳跃则在小数据集上导致过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。