[论文解读] Zero-shot Visual Question Answering using Knowledge Graph
本文提出了一种基于知识图谱的零样本视觉问答(ZS-VQA)方法,通过基于掩码的学习将图像-问题对与外部知识对齐,从而实现对未见答案的准确预测。通过在ZS-VQA中使用硬掩码,在标准VQA中使用软掩码,该模型在未见答案上的表现达到当前最优水平,并显著提升了F-VQA数据集上基线端到端模型的性能。
Incorporating external knowledge to Visual Question Answering (VQA) has become a vital practical need. Existing methods mostly adopt pipeline approaches with different components for knowledge matching and extraction, feature learning, etc.However, such pipeline approaches suffer when some component does not perform well, which leads to error propagation and poor overall performance. Furthermore, the majority of existing approaches ignore the answer bias issue -- many answers may have never appeared during training (i.e., unseen answers) in real-word application. To bridge these gaps, in this paper, we propose a Zero-shot VQA algorithm using knowledge graphs and a mask-based learning mechanism for better incorporating external knowledge, and present new answer-based Zero-shot VQA splits for the F-VQA dataset. Experiments show that our method can achieve state-of-the-art performance in Zero-shot VQA with unseen answers, meanwhile dramatically augment existing end-to-end models on the normal F-VQA task.
研究动机与目标
- 解决开放世界场景理解中未见答案的零样本VQA挑战。
- 通过引入统一的、端到端兼容的框架,克服流水线式VQA方法中的误差传播问题。
- 构建一个新的ZS-F-VQA数据集,以评估模型在未见答案上的零样本泛化能力。
- 通过自适应掩码策略,使模型能够灵活应用于标准VQA和ZS-VQA任务。
- 通过知识图谱对齐整合外部知识,提升现有端到端模型的性能。
提出的方法
- 学习三种不同的特征映射空间:语义(关系)、对象(支持实体)和知识(答案),以实现图像-问题嵌入的联合对齐。
- 基于包含所有三元组的事实型知识图谱,构建映射表,以支持实体和关系为基础生成掩码。
- 在预测未见答案的ZS-VQA任务中应用硬掩码,利用高置信度对齐分数作为约束条件。
- 在标准VQA任务中应用软掩码,以减少误差传播,通过较低置信度的引导实现逐步预测修正。
- 使用阈值(分数 ≥100)根据图像-问题对与目标实体/关系之间的相似度分数,区分硬掩码与软掩码的应用。
- 将掩码机制集成到答案预测头中,根据知识图谱对齐结果动态调整预测分数。
实验结果
研究问题
- RQ1基于知识图谱的方法能否有效预测在训练过程中从未出现过的视觉问答答案?
- RQ2如何设计掩码策略,以在零样本场景中提供强引导,同时在标准VQA中最小化干扰?
- RQ3来自知识图谱的外部知识在多大程度上能提升VQA模型对未见答案的泛化能力?
- RQ4当知识图谱中支持实体和关系的数量不同时,模型性能如何变化?
- RQ5所提出的方法是否无需架构修改即可灵活应用于零样本和标准VQA任务?
主要发现
- 所提方法在新构建的ZS-F-VQA数据集上达到最先进性能,未见答案预测的准确率较现有方法提升30–40%。
- 在标准F-VQA基准上,该方法使基线端到端模型的准确率提升6–9%,表明在各类任务中均具有一致性增益。
- 硬掩码在零样本设置中显著提升性能,通过强制与知识图谱事实强对齐,尤其在训练数据稀缺时效果更明显。
- 软掩码在标准VQA设置中更为有效,其作为温和约束可减少误差传播,避免对可能错误的先验预测产生过度依赖。
- 模型具有较强的可解释性:可视化结果表明,该模型利用结构化知识引导预测,而基线模型则依赖表面模式或记忆化答案。
- 该方法在多答案预测中也表现出良好泛化能力,其概率评分机制可对多个合理答案进行排序,包括罕见或未见答案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。