[论文解读] Multimodal Integration of Human-Like Attention in Visual Question Answering
该论文提出MULAN,这是首个将文本和图像模态的人类注意力机制整合到基于Transformer的VQA模型中的方法。通过使用最先进的文本和图像显著性模型预测结果来修改自注意力评分函数,MULAN在VQAv2测试-std上实现了73.98%的最先进准确率,在test-dev上达到73.72%,且参数量相比先前模型减少了约80%。
Human-like attention as a supervisory signal to guide neural attention has shown significant promise but is currently limited to uni-modal integration - even for inherently multimodal tasks such as visual question answering (VQA). We present the Multimodal Human-like Attention Network (MULAN) - the first method for multimodal integration of human-like attention on image and text during training of VQA models. MULAN integrates attention predictions from two state-of-the-art text and image saliency models into neural self-attention layers of a recent transformer-based VQA model. Through evaluations on the challenging VQAv2 dataset, we show that MULAN achieves a new state-of-the-art performance of 73.98% accuracy on test-std and 73.72% on test-dev and, at the same time, has approximately 80% fewer trainable parameters than prior work. Overall, our work underlines the potential of integrating multimodal human-like and neural attention for VQA
研究动机与目标
- 解决先前工作仅在图像上整合人类注意力,而未在文本上整合的局限性,以提升视觉问答性能。
- 探究多模态人类注意力是否能提升VQA模型的推理与泛化能力。
- 通过人类注意力带来的归纳偏置,降低模型复杂度,同时保持或提升性能。
- 评估多模态人类注意力对长句和复合问题的影响。
- 通过分析注意力分布和失败案例,提升模型的可解释性。
提出的方法
- MULAN将文本显著性模型(TSM)和图像显著性模型(多时长模型)的预测结果,整合到基于MCAN的VQA Transformer的注意力评分函数中。
- 该方法通过在查询-键交互计算过程中引入类人注意力图作为归纳偏置,对自注意力机制进行修改。
- 模型在VQAv2数据集上端到端训练,以MCAN小模型架构作为主干网络。
- 文本中的人类注意力通过最近提出的文本显著性模型(TSM)建模,并针对VQA任务进行适配。
- 图像显著性预测来自一个能捕捉视觉注意力时间动态的多时长效应显著性模型。
- 整合操作在注意力层级别进行,直接在特征融合前修改注意力权重。
实验结果
研究问题
- RQ1是否能够通过同时来自文本和图像的多模态人类注意力,使VQA性能超越单模态监督的水平?
- RQ2整合人类注意力是否能降低对数据集偏差的依赖,特别是在长句或复杂问题中?
- RQ3人类注意力图能否作为有效的归纳偏置,以提升模型泛化能力并减少参数量?
- RQ4多模态人类注意力如何影响注意力分布与模型可解释性?
- RQ5与标准模型相比,该整合是否能带来更稳定的注意力收敛过程?
主要发现
- MULAN在VQAv2测试-std划分上实现了73.98%的新最先进准确率,在test-dev上达到73.72%,优于先前方法。
- 与先前SOTA模型相比,MULAN将可训练参数量减少了约80%,同时保持了更优的性能。
- 在长句(7个以上词)上,MULAN表现出显著的相对提升,相对增益达0.3%或以上,表明其对复杂查询的处理能力更强。
- 注意力可视化结果表明,MULAN聚焦于相关图像区域和关键问题词(如“digging”、“fridge”),而基线模型则更广泛地分散注意力。
- 模型收敛到稳定注意力分布的速度更快,表明初始人类注意力图有效引导了学习过程。
- 在类别分析中,MULAN在12个类别中的10个类别达到最高准确率,尤其在动作识别和情感分析任务中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。