[论文解读] A Dataset and Baselines for Visual Question Answering on Art
本文提出AQUA,一个专注于艺术作品的视觉问答(VQA)数据集,结合绘画中的视觉问题与相关评论中的知识型问题。该研究提出VIKING基线模型,采用双分支架构分别处理视觉与知识模态,其在AQUA上的优异表现证明了在艺术内容VQA中整合外部艺术知识的重要性。
Answering questions related to art pieces (paintings) is a difficult task, as it implies the understanding of not only the visual information that is shown in the picture, but also the contextual knowledge that is acquired through the study of the history of art. In this work, we introduce our first attempt towards building a new dataset, coined AQUA (Art QUestion Answering). The question-answer (QA) pairs are automatically generated using state-of-the-art question generation methods based on paintings and comments provided in an existing art understanding dataset. The QA pairs are cleansed by crowdsourcing workers with respect to their grammatical correctness, answerability, and answers' correctness. Our dataset inherently consists of visual (painting-based) and knowledge (comment-based) questions. We also present a two-branch model as baseline, where the visual and knowledge questions are handled independently. We extensively compare our baseline model against the state-of-the-art models for question answering, and we provide a comprehensive study about the challenges and potential future directions for visual question answering on art.
研究动机与目标
- 建立一个针对艺术作品视觉问答的新基准,该基准要求兼具视觉理解与艺术史知识。
- 弥补现有VQA数据集仅关注现实世界图像、忽视艺术抽象与语境知识的不足。
- 构建一个通过自动生成并经人工验证的QA对数据集,反映绘画中视觉与知识型推理的结合。
- 开发一个基线模型VIKING,有效整合视觉与外部知识模态,以应对艺术特定的VQA任务。
- 识别艺术领域VQA的关键挑战与未来方向,尤其关注非现实主义风格的处理与外部知识检索。
提出的方法
- AQUA数据集通过在SemArt数据集的绘画及其相关评论上使用最先进的问题生成模型,自动生成QA对构建而成。
- 问题被划分为视觉型(基于图像内容)与知识型(基于评论)两类,两类问题均源自相同的输入源。
- 通过多阶段众包流程验证语法正确性、可回答性与答案准确性,确保QA对的高质量。
- VIKING基线模型采用双分支架构:一个分支使用视觉编码器处理绘画的视觉特征,另一个分支使用文本编码器处理从检索评论中获得的外部知识。
- 模态选择器根据问题动态选择视觉或知识分支,提升对问题类型的适应能力。
- 外部知识检索采用两阶段流程:首先使用TF-IDF结合预处理与n-gram特征,随后通过BERT模型进行重排序,以提升top-k位置的召回率。
实验结果
研究问题
- RQ1如何通过自动化生成与人工验证,构建大规模、高质量的艺术作品VQA数据集?
- RQ2像VIKING这样的双分支模型在艺术特定的VQA任务中,相较于标准VQA与文本QA模型,能多大程度上实现性能超越?
- RQ3整合外部知识(如评论或Wikipedia)对基于艺术的VQA系统性能有何影响?
- RQ4非现实主义艺术风格如何影响标准视觉模型在VQA中的表现?可采取哪些改进措施?
- RQ5在绘画的视觉感知与艺术史知识结合中,实现准确问答的关键挑战是什么?
主要发现
- VIKING模型在AQUA数据集上显著优于现有SOTA的VQA与文本QA模型,为未来研究建立了强有力的基线。
- VIKING中的模态选择器在超过90%的测试样本中正确选择了相关分支(视觉或知识),表明模态区分能力出色。
- 两阶段外部知识检索流程在使用TF-IDF结合预处理与n-gram特征时,实现R@10为90.7%;经BERT重排序后,R@10进一步提升至90.7%。
- 完整VIKING模型(包含视觉与知识双分支)的准确率达到0.996,仅添加知识分支并未带来显著性能增益,表明两种模态之间存在强烈协同效应。
- 模型的失败案例大多合理,涉及需要另一模态支持的问题,表明系统能正确识别模态依赖关系。
- 本研究识别出若干关键局限:自动QA生成限制了问题多样性,基于现实世界图像训练的目标检测器在非现实主义风格上表现不佳,且知识检索依赖单一来源(SemArt评论),而非独立来源如Wikipedia。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。