[论文解读] Bipartite Graph Network with Adaptive Message Passing for Unbiased Scene Graph Generation
本文提出一种具有自适应消息传递机制的置信度感知二部图神经网络(BGNN),以提升无偏场景图生成性能,解决长尾分布与噪声上下文建模问题。通过整合双层数据重采样策略与基于关系置信度的动态边权重机制,该方法在Visual Genome、Open Images V4与V6数据集上均达到最先进性能,显著提升尾部类别召回率,同时保持优异的整体准确率。
Scene graph generation is an important visual understanding task with a broad range of vision applications. Despite recent tremendous progress, it remains challenging due to the intrinsic long-tailed class distribution and large intra-class variation. To address these issues, we introduce a novel confidence-aware bipartite graph neural network with adaptive message propagation mechanism for unbiased scene graph generation. In addition, we propose an efficient bi-level data resampling strategy to alleviate the imbalanced data distribution problem in training our graph network. Our approach achieves superior or competitive performance over previous methods on several challenging datasets, including Visual Genome, Open Images V4/V6, demonstrating its effectiveness and generality.
研究动机与目标
- 解决视觉关系中的长尾分布与高类内差异问题,避免场景图模型对头部类别产生偏差。
- 通过在基于图的消息传递中过滤噪声的主语-宾语关联,减少上下文建模中的误差传播。
- 通过新颖的训练策略提升低资源(尾部)谓词与对象类别的性能。
- 构建一种结构化、置信度感知的图网络,相比全连接图或稀疏图,更有效地建模实体-谓词关系。
- 在端到端场景图生成中实现头部类别与尾部类别性能之间的更好权衡。
提出的方法
- 该方法使用带方向边的二部图神经网络(BGNN),分别建模实体与谓词提议之间的信息流。
- 提出一种自适应消息传递机制,根据预测的关系置信度动态加权消息传播,降低低置信度关系带来的噪声影响。
- 采用多阶段训练流程,通过在实体与谓词节点间迭代进行消息传递,逐步优化表示。
- 双层数据重采样策略结合图像级过采样与实例级欠采样,在训练过程中平衡头部与尾部类别。
- 通过消息传递对实体与谓词表示进行优化,随后使用线性分类器进行分类。
- 消息传递的置信度估计在训练过程中端到端学习,实现动态噪声抑制。
![Figure 1 : The illustration of biased scene graph generation and empirical study on Visual Genome. As shown in (D), the baseline (MSDN [ 23 ] ) performance is dominated by the head categories due to the imbalanced data. We estimate an upper-bound performance by ignoring negative predicate-entity con](https://ar5iv.labs.arxiv.org/html/2104.00308/assets/x1.png)
实验结果
研究问题
- RQ1基于关系置信度的自适应消息传递是否能减少场景图生成中的误差传播?
- RQ2双层数据重采样策略是否能提升模型在低频(尾部)谓词与对象上的泛化能力?
- RQ3在长尾分布下,二部图结构是否能优于全连接图或稀疏图,更有效地建模视觉关系?
- RQ4在基准数据集上,所提方法在平均召回率与加权AP指标上与最先进模型相比表现如何?
- RQ5从实证角度观察,移除噪声的主语-宾语关联在多大程度上能提升基线性能?
主要发现
- 在Open Images V6上,所提BGNN的mR@50达到40.45,优于先前方法如GPS-Net(38.93)与RelDN(37.20)。
- 在Open Images V6上,模型的加权指标得分为42.06,超过此前最先进方法GPS-Net*(41.60)。
- 在Visual Genome上,当使用三阶段与三轮迭代时,该方法达到mR@100为12.6,尾部类别召回率为6.0,展现出对低频关系的强性能。
- 消融实验表明,3轮迭代与3个阶段达到最优性能,性能在该点后趋于饱和。
- 实证研究显示,移除噪声的主语-宾语关联可提升基线性能,验证了置信度感知消息传递的必要性。
- 双层重采样策略实现了头部与尾部类别间的更好权衡,在不降低头部类别准确率的前提下提升了稀有谓词的性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。