[论文解读] Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering
本文提出了一种新型视觉问答框架——基于模态内与模态间注意力流的动态融合(DFAF),通过交替进行模态间协同注意力与模态条件化的模态内自注意力,动态融合视觉与语言特征。该方法在VQA 2.0上实现了最先进性能,整体准确率达到70.34%,通过联合建模模态间与模态内高层交互关系,同时将模态内注意力条件化于另一模态的内容,实现更优的特征融合。
Learning effective fusion of multi-modality features is at the heart of visual question answering. We propose a novel method of dynamically fusing multi-modal features with intra- and inter-modality information flow, which alternatively pass dynamic information between and across the visual and language modalities. It can robustly capture the high-level interactions between language and vision domains, thus significantly improves the performance of visual question answering. We also show that the proposed dynamic intra-modality attention flow conditioned on the other modality can dynamically modulate the intra-modality attention of the target modality, which is vital for multimodality feature fusion. Experimental evaluations on the VQA 2.0 dataset show that the proposed method achieves state-of-the-art VQA performance. Extensive ablation studies are carried out for the comprehensive analysis of the proposed method.
研究动机与目标
- 解决现有VQA方法主要关注模态间关系而忽略视觉与语言模态内部互补关系的局限性。
- 开发一种统一框架,联合建模模态间与模态内信息流,以提升VQA中的特征融合效果。
- 通过另一模态的内容动态调节模态内注意力,实现在每个模态内进行上下文感知的特征优化。
- 通过迭代注意力流捕捉视觉区域与问题词汇之间的复杂高层交互,从而提升VQA性能。
提出的方法
- 该框架采用交替的模态间注意力流(InterMAF)与动态模态内注意力流(DyIntraMAF)模块,实现模态间与模态内信息传递。
- InterMAF计算视觉区域与问题词汇之间的联合协同注意力矩阵,通过注意力加权聚合实现跨模态特征融合。
- DyIntraMAF在每个模态内应用自注意力,但通过另一模态的特征动态调制注意力权重,增强上下文感知的特征学习能力。
- 模态内注意力的动态调制确保仅保留相关的信息流,从而提升特征表示质量。
- 通过堆叠多个DFAF模块,逐步优化特征,聚焦于显著的图像区域与问题词汇。
- 模型整合自下而上的目标检测特征与上下文嵌入(如BERT)以增强输入表示。
实验结果
研究问题
- RQ1与仅关注模态间交互的方法相比,联合建模模态内与模态间注意力流是否能提升VQA性能?
- RQ2利用另一模态的信息调制模态内注意力,对特征表示与下游任务准确率有何影响?
- RQ3所提出的动态融合机制是否优于静态或纯粹内部模态内信息传递的基线方法?
- RQ4该框架在不同类型的问题(如是/否、计数、开放式问题)上具有多大程度的泛化能力?
主要发现
- 所提出的DFAF框架在VQA 2.0测试开发集上达到86.09%的准确率,超越先前最先进方法。
- 使用基于BERT的上下文嵌入时,模型在测试开发集上达到86.73%,在整体测试标准集上达到70.81%,创下新SOTA记录。
- 消融实验表明,由另一模态调制的DyIntraMAF显著优于未引入跨模态条件的常规模态内自注意力。
- 可视化结果表明,DyIntraMAF能根据问题动态过滤无关区域,生成更具可解释性与准确性的注意力权重。
- 添加绝对或相对位置嵌入会降低性能,表明模型依赖于基于注意力的推理,而非位置先验。
- 在相同参数预算下,使用8个注意力头的性能优于1、4或8个头,证实多头注意力在该框架中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。