[论文解读] Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning
本文提出了 Super-CLEVR,一个可控的虚拟基准,通过隔离四个关键因素——视觉复杂度、问题冗余度、概念分布和概念组合性——来诊断视觉推理中的领域鲁棒性。通过在这些受控的分布变化上训练和测试 VQA 模型——包括一种新型的概率性 NSVQA(P-NSVQA),其整合了不确定性推理——作者发现,将感知与推理解耦并建模不确定性可显著提升鲁棒性,其中 P-NSVQA 在四个领域偏移因素中的三个上优于现有方法。
Visual Question Answering (VQA) models often perform poorly on out-of-distribution data and struggle on domain generalization. Due to the multi-modal nature of this task, multiple factors of variation are intertwined, making generalization difficult to analyze. This motivates us to introduce a virtual benchmark, Super-CLEVR, where different factors in VQA domain shifts can be isolated in order that their effects can be studied independently. Four factors are considered: visual complexity, question redundancy, concept distribution and concept compositionality. With controllably generated data, Super-CLEVR enables us to test VQA methods in situations where the test data differs from the training data along each of these axes. We study four existing methods, including two neural symbolic methods NSCL and NSVQA, and two non-symbolic methods FiLM and mDETR; and our proposed method, probabilistic NSVQA (P-NSVQA), which extends NSVQA with uncertainty reasoning. P-NSVQA outperforms other methods on three of the four domain shift factors. Our results suggest that disentangling reasoning and perception, combined with probabilistic uncertainty, form a strong VQA model that is more robust to domain shifts. The dataset and code are released at https://github.com/Lizw14/Super-CLEVR.
研究动机与目标
- 为解决由于视觉、语言和推理之间变化交织而导致的 VQA 领域偏移中贡献因素缺乏系统性分析的问题。
- 开发一个可控的虚拟基准,以实现对视觉问答中领域偏移因素的独立研究。
- 在隔离的领域偏移因素上评估现有 VQA 模型,并诊断其鲁棒性弱点。
- 通过将不确定性推理整合到神经符号 VQA 框架中,提升模型鲁棒性。
- 通过将 Super-CLEVR 中的合成发现迁移到真实 GQA 数据集,验证研究结果在真实世界数据上的有效性。
提出的方法
- Super-CLEVR 使用 UDA-Part 数据集中 3D 车辆模型生成合成 VQA 数据,对视觉复杂度、问题冗余度、概念分布和组合性进行受控变化。
- 通过模板自动生成问题和答案,从而精确控制每个领域偏移因素。
- 该基准支持四个独立的领域偏移轴:(1) 视觉复杂度(物体数量、纹理),(2) 问题冗余度(冗余与最小化表达),(3) 概念分布(概念先验的偏移),以及 (4) 概念组合性(训练中未见的新组合)。
- 评估了四种现有模型:FiLM(非符号化)、mDETR(大规模预训练)、NSCL 和 NSVQA(神经符号化)。
- 提出一种新模型——概率性 NSVQA(P-NSVQA),通过在 NSVQA 的符号执行器中注入不确定性估计,实现对推理步骤的概率聚合。
- 在每个孤立因素下,于域内和域外设置中评估模型性能,并进行方法间的消融与对比。

实验结果
研究问题
- RQ1不同领域偏移因素——视觉复杂度、问题冗余度、概念分布和组合性——如何影响 VQA 模型的鲁棒性?
- RQ2在受控领域偏移下,模块化神经符号方法在多大程度上优于非模块化模型?
- RQ3在符号化 VQA 模型中整合不确定性推理,是否能提升其在多样化领域偏移因素下的鲁棒性?
- RQ4来自 Super-CLEVR 等合成基准的发现,是否能推广到真实世界 VQA 数据集(如 GQA)?
- RQ5哪些特定的架构选择(如感知与推理的解耦、不确定性建模)能带来更好的领域泛化能力?
主要发现
- P-NSVQA 在四个领域偏移因素中的三个上优于所有基线模型:问题冗余度、概念分布和概念组合性。
- 与 FiLM 和 mDETR 等非模块化模型相比,模块化神经符号方法(如 NSVQA)在问题冗余度方面表现出更强的鲁棒性。
- 非模块化模型 mDETR 在视觉复杂度偏移上的鲁棒性优于模块化模型,表明模块化与视觉复杂度鲁棒性之间存在权衡。
- 在真实 GQA 数据集上,随着冗余问题信息逐步被移除,mDETR 的准确率显著下降(−14.56%),而神经符号模型的下降幅度较小(P-NSVQA 为 −5.78%),与 Super-CLEVR 的发现一致。
- 当 100% 的冗余信息被移除时,mDETR 的性能下降了 −14.56%,而 P-NSVQA 仅下降 −5.78%,表明其在真实世界设置中对问题冗余度具有更强的鲁棒性。
- 研究结果证实,将感知与推理解耦,并结合显式的不确定性建模,可显著提升 VQA 模型在多样化领域偏移下的整体鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。