[论文解读] Generalized Unbiased Scene Graph Generation
本文提出广义无偏场景图生成(G-USGG),一种新颖的框架,旨在解决场景图生成中的谓词级别与概念级别类别不平衡问题。该框架提出多概念学习(MCL),结合概念正则化与平衡原型记忆,确保对稀有、不常见及常见主语-宾语概念组合的均衡表征学习,在VG-SGG与OI-SGG基准上取得最先进性能。
Existing Unbiased Scene Graph Generation (USGG) methods only focus on addressing the predicate-level imbalance that high-frequency classes dominate predictions of rare ones, while overlooking the concept-level imbalance. Actually, even if predicates themselves are balanced, there is still a significant concept-imbalance within them due to the long-tailed distribution of contexts (i.e., subject-object combinations). This concept-level imbalance poses a more pervasive and challenging issue compared to the predicate-level imbalance since subject-object pairs are inherently complex in combinations. Hence, we introduce a novel research problem: Generalized Unbiased Scene Graph Generation (G-USGG), which takes into account both predicate-level and concept-level imbalance. To the end, we propose the Multi-Concept Learning (MCL) framework, which ensures a balanced learning process across rare/ uncommon/ common concepts. MCL first quantifies the concept-level imbalance across predicates in terms of different amounts of concepts, representing as multiple concept-prototypes within the same class. It then effectively learns concept-prototypes by applying the Concept Regularization (CR) technique. Furthermore, to achieve balanced learning over different concepts, we introduce the Balanced Prototypical Memory (BPM), which guides SGG models to generate balanced representations for concept-prototypes. Extensive experiments demonstrate the remarkable efficacy of our model-agnostic strategy in enhancing the performance of benchmark models on both VG-SGG and OI-SGG datasets, leading to new state-of-the-art achievements in two key aspects: predicate-level unbiased relation recognition and concept-level compositional generability.
研究动机与目标
- 为解决无偏场景图生成中被忽视的概念级别不平衡问题,该问题源于主语-宾语对的长尾分布,尽管谓词已实现平衡。
- 形式化一个新研究问题——广义无偏场景图生成(G-USGG),联合缓解谓词级别与概念级别的数据不平衡。
- 开发一种模型无关的策略,提升在稀有、不常见与常见概念组合上的公平性与泛化能力。
- 通过均衡表征学习,提升SGG模型在无偏关系识别与组合生成能力方面表现。
提出的方法
- 通过基于不同概念频率在相同谓词类别内建模多个概念原型,量化概念级别不平衡。
- 应用概念正则化(CR)显式学习并解耦每个谓词类别内的不同概念原型。
- 引入平衡原型记忆(BPM),动态平衡不同频率级别下概念原型的表征学习。
- 采用记忆增强机制,引导模型为稀有、不常见与常见概念生成同等鲁棒的特征。
- 设计一种对主干SGG模型无感知的多概念学习框架,支持即插即用式集成。
- 端到端训练模型,采用概念原型上的对比损失,以促进判别性与均衡的特征学习。
实验结果
研究问题
- RQ1由主语-宾语组合的长尾分布驱动的概念级别不平衡,如何影响无偏场景图生成模型的性能?
- RQ2统一框架能否有效缓解SGG中的谓词级别与概念级别数据不平衡?
- RQ3模型无关学习策略在多大程度上可提升对稀有与常见概念组合的泛化能力?
- RQ4所提出的平衡原型记忆如何提升不同概念频率级别下的表征公平性?
- RQ5多概念学习框架是否能同时提升SGG模型的无偏关系识别与组合生成能力?
主要发现
- 所提出的MCL框架在VG-SGG与OI-SGG基准上均实现了无偏关系识别的最先进性能。
- 模型在零样本与少样本设置下表现显著提升,展现出对稀有与不常见概念更强的组合生成能力。
- 概念正则化有效解耦并学习同一谓词类别内的不同概念原型,提升表征质量。
- 平衡原型记忆通过强制均衡特征学习,成功缓解了稀有概念上的性能下降。
- 该框架具有模型无关性,在无需修改架构的前提下,显著提升多个基线SGG模型的性能。
- 大量消融实验验证了概念级别建模与平衡记忆组件在减轻不平衡相关偏差方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。