[论文解读] Learning Visual Commonsense for Robust Scene Graph Generation
本文提出了一种新颖的方法——全局-局部注意力变换器(GLAT),无需外部知识,即可从场景图数据中自动学习视觉常识,例如物体功能和直觉物理。通过将感知与常识分离为独立模型,并基于置信度融合其输出,该方法纠正了场景图生成中的不合理预测,在Visual Genome数据集上显著提升了准确率,尤其在罕见和零样本场景下表现突出。
Scene graph generation models understand the scene through object and predicate recognition, but are prone to mistakes due to the challenges of perception in the wild. Perception errors often lead to nonsensical compositions in the output scene graph, which do not follow real-world rules and patterns, and can be corrected using commonsense knowledge. We propose the first method to acquire visual commonsense such as affordance and intuitive physics automatically from data, and use that to improve the robustness of scene understanding. To this end, we extend Transformer models to incorporate the structure of scene graphs, and train our Global-Local Attention Transformer on a scene graph corpus. Once trained, our model can be applied on any scene graph generation model and correct its obvious mistakes, resulting in more semantically plausible scene graphs. Through extensive experiments, we show our model learns commonsense better than any alternative, and improves the accuracy of state-of-the-art scene graph generation methods.
研究动机与目标
- 解决现有场景图生成(SGG)模型因现实世界视觉挑战而易受感知错误影响的局限性。
- 克服现有SGG模型对不完整或有偏见的外部常识知识库或简单共现统计的依赖。
- 开发一种自监督方法,直接从标注的场景图语料库中学习结构化的视觉常识。
- 设计一种智能融合机制,基于模型置信度结合感知与常识输出,以提升鲁棒性。
- 通过避免常识学习中的数据集偏差,确保方法在罕见和零样本场景下的泛化能力。
提出的方法
- 提出一种基于场景图掩码自编码的自监督预训练框架,利用上下文预测被掩码的实体或谓词。
- 通过引入局部注意力头扩展Transformer架构,显式建模场景图中的结构依赖关系,提升图感知表示学习能力。
- 在大规模标注场景图语料库上训练全局-局部注意力变换器(GLAT),以学习物体功能、直觉物理等视觉常识模式。
- 将SGG流程解耦为两个独立训练的模型:感知模型(如IMP、SNM、KERN)和常识模型(GLAT)。
- 设计一种置信度感知的融合模块,结合两个模型的预测结果,对每个三元组赋予更高置信度输出更大的权重。
- 利用融合模块在感知不确定时(如低光照条件)借助常识推理纠正不合理预测,例如误分类的物体或不合理的关联关系。
实验结果
研究问题
- RQ1能否在不依赖外部知识的情况下,直接从场景图数据中学习视觉常识(如物体功能和直觉物理)?
- RQ2如何训练模型以识别并纠正场景图生成中的感知错误,利用结构化常识?
- RQ3常识模型在不继承数据集偏差的前提下,能在多大程度上泛化到罕见或零样本实例?
- RQ4如何以尊重不确定性的方式融合感知与常识,从而提升整体鲁棒性?
- RQ5基于置信度的融合机制是否优于简单的平均法或固定规则的集成方法,在纠正SGG错误方面表现更优?
主要发现
- 在场景图数据上的掩码预测准确率衡量下,GLAT在学习视觉常识方面优于传统Transformer和图神经网络模型。
- 与最佳基线模型(KERN)相比,感知与常识模型的融合在Visual Genome数据集上将mR@50的平均召回率提升最多1.4个百分点,mR@100提升最多0.9个百分点。
- GLAT学习到了复杂的常识模式,如物体功能(例如椅子用于就座)和直觉物理(例如物体不会漂浮),这些在标准SGG模型中并不存在。
- 该方法对数据集偏差具有鲁棒性:在罕见或零样本场景中能正确纠正错误,如误分类的鸟类或戴在鸟身上的帽子。
- 融合机制有效利用置信度分数,在感知不确定时(如低光照条件)优先采用常识推理,在感知自信时则优先采用感知输出。
- 消融实验表明,无论使用IMP、SNM还是KERN等SGG方法,添加GLAT和融合模块均能持续提升性能,证实了其泛化能力与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。