[论文解读] 2nd Place Solution to the GQA Challenge 2019
本文提出GQA Challenge 2019的第二名解决方案,提出一种方法:利用单张图像相关问题中高频词的统计特征,作为视觉问答任务的知识库。通过使用基于问题频率的统计特征,而非检测到的视觉特征,模型实现了接近真实特征的性能,表明特征提取是视觉推理的主要瓶颈,而非推理能力本身。
We present a simple method that achieves unexpectedly superior performance for Complex Reasoning involved Visual Question Answering. Our solution collects statistical features from high-frequency words of all the questions asked about an image and use them as accurate knowledge for answering further questions of the same image. We are fully aware that this setting is not ubiquitously applicable, and in a more common setting one should assume the questions are asked separately and they cannot be gathered to obtain a knowledge base. Nonetheless, we use this method as an evidence to demonstrate our observation that the bottleneck effect is more severe on the feature extraction part than it is on the knowledge reasoning part. We show significant gaps when using the same reasoning model with 1) ground-truth features; 2) statistical features; 3) detected features from completely learned detectors, and analyze what these gaps mean to researches on visual reasoning topics. Our model with the statistical features achieves the 2nd place in the GQA Challenge 2019.
研究动机与目标
- 探究在复杂、自然图像数据集上,视觉问答(VQA)的性能瓶颈是否源于特征提取或推理能力的限制。
- 评估使用真实视觉特征、检测到的视觉特征以及基于问题频率推导出的统计特征之间的性能差距。
- 证明当提供高质量知识时,即使特征未通过视觉检测获得,推理模型也能实现接近理想的表现。
- 分析超类传播、形容词/非形容词分离以及谓词分组等架构选择对属性和关系检测的影响。
- 基于不同特征类型的消融实验,提供实证证据表明,自然图像中视觉感知的难度高于复杂推理的难度。
提出的方法
- 模型采用两阶段流水线:先进行视觉特征提取,再使用MAC(组合注意力网络)主干进行组合推理。
- 对象检测使用Faster R-CNN;属性和关系检测则训练了受先前工作启发的定制模型,采用修改后的损失函数和数据处理方式。
- 将对象类别中的复数形式归一化为单数形式,以提升mAP,使其从8.42提升至10.08。
- 在推理过程中通过遍历WordNet层级结构添加超类,确保若某一类别为真,则其所有超类也为真。
- 根据WordNet中是否存在非空形容词同义词集,将属性分为形容词和非形容词两类,以实现对视觉属性的独立建模。
- 将关系谓词划分为空间、交互和其他三类,并通过动词同义词集检查筛选交互类型。
实验结果
研究问题
- RQ1VQA模型的性能差距是否源于视觉特征提取的限制,而非推理能力?
- RQ2当推理模型分别接收真实特征、检测特征或基于问题频率推导的统计特征时,其性能如何变化?
- RQ3问题表述中的统计模式在多大程度上可以弥补视觉检测中的误差?
- RQ4超类传播和类别分组等架构选择如何影响检测准确率及下游推理性能?
- RQ5检测特征与统计特征之间的性能差距是否表明视觉感知是VQA的主要瓶颈?
主要发现
- 基于高频问题词汇推导出的统计特征,在MAC模型上实现了76.15%的验证准确率,接近真实特征的81.14%性能。
- 检测特征(MAC模型下为62.98%)与统计特征(76.15%)之间的性能差距,显著大于统计特征与真实特征之间的差距,表明检测错误是失败的主要原因。
- MS-CA模型在使用统计特征时实现了69.67%的验证准确率,表明即使强大的推理模型也能从更优的知识表征中获益。
- 消融研究显示,不同推理模型之间的性能差距小于不同特征类型之间的差距,表明特征质量比模型架构更为关键。
- 推理过程中使用超类提升了检测的鲁棒性,而将形容词与非形容词分离则通过实现更集中的学习,提升了属性检测性能。
- 结果支持如下观点:VQA的瓶颈并非推理能力,而是从自然图像中提取视觉特征的不准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。