[论文解读] Multilevel Hierarchical Network with Multiscale Sampling for Video Question Answering
本文提出了一种多级分层网络(MHN),采用多尺度采样技术用于视频问答任务,将多尺度视觉外观-运动特征与多级深度学习表征相结合。该方法通过循环多模态交互模块,在不同尺度上迭代优化与问题相关的视觉表征,同时利用共享Transformer编码器的并行视觉推理模块,联合推理多级表征,从而在TGIF-QA、MSRVTT-QA和MSVD-QA数据集上实现最先进性能。
Video question answering (VideoQA) is challenging given its multimodal combination of visual understanding and natural language processing. While most existing approaches ignore the visual appearance-motion information at different temporal scales, it is unknown how to incorporate the multilevel processing capacity of a deep learning model with such multiscale information. Targeting these issues, this paper proposes a novel Multilevel Hierarchical Network (MHN) with multiscale sampling for VideoQA. MHN comprises two modules, namely Recurrent Multimodal Interaction (RMI) and Parallel Visual Reasoning (PVR). With a multiscale sampling, RMI iterates the interaction of appearance-motion information at each scale and the question embeddings to build the multilevel question-guided visual representations. Thereon, with a shared transformer encoder, PVR infers the visual cues at each level in parallel to fit with answering different question types that may rely on the visual information at relevant levels. Through extensive experiments on three VideoQA datasets, we demonstrate improved performances than previous state-of-the-arts and justify the effectiveness of each part of our method.
研究动机与目标
- 为解决现有视频问答方法忽略不同时间粒度下多尺度视觉外观-运动信息的问题。
- 探究如何有效整合多尺度视觉特征与深度神经网络的多级表征学习能力。
- 设计一种支持问题引导、尺度感知的视觉推理的模型架构,以应对多样化的问题类型。
- 通过实现分层、循环的多模态交互与多级并行视觉推理,提升视频问答性能。
提出的方法
- 该模型采用多尺度采样,从输入视频中提取不同时间粒度的帧组。
- 循环多模态交互(RMI)模块通过堆叠的、循环连接的多模态模块块,在不同尺度上迭代优化与问题相关的视觉表征。
- 每个多模态交互模块块处理特定尺度下的帧组,通过问题嵌入与外观-运动特征之间的交叉注意力机制进行交互。
- 并行视觉推理(PVR)模块使用共享Transformer编码器,同时处理所有RMI模块的输出,实现跨层级的联合推理。
- PVR中共享的Transformer编码器在减少参数量的同时,保持了强大的特征融合与推理能力。
- 该架构在三个视频问答基准数据集上端到端进行训练:TGIF-QA、MSRVTT-QA和MSVD-QA。
实验结果
研究问题
- RQ1如何有效将多尺度视觉外观-运动特征整合进深度学习模型以用于视频问答?
- RQ2多级处理对在不同时间尺度上建模与问题相关的视觉线索有何影响?
- RQ3跨尺度的循环多模态交互如何提升问题引导的视觉表征学习?
- RQ4对多级特征进行并行推理是否能提升视频问答中多样化问题类型的表现?
- RQ5在分层视觉推理的背景下,多尺度采样的最优时间尺度数量是多少?
主要发现
- MHN模型在TGIF-QA数据集上达到最先进性能,其中Action任务准确率为83.5%,Trans.任务为90.8%,FrameQA任务为58.1%,Count任务为3.58。
- 在RMI中移除循环连接会显著降低所有任务的性能,证明多级交互对特征优化至关重要。
- 仅使用PVR中最后一层输出的性能低于使用所有层级的输出,证实多级推理具有显著价值。
- 将尺度数量从N=2增加到N=4可提升FrameQA和Count任务的性能,且在TGIF-QA上N=3时达到最优。
- 采用每级独立Transformer编码器的变体性能略有提升,但参数量增至22.8M;而默认的共享编码器模型(16.5M)在性能上优于更大的模型如PSAC和HME。
- 消融实验表明,多尺度视觉信息与多级处理对实现鲁棒的视频问答性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。