[论文解读] Tackling the Unannotated: Scene Graph Generation with Bias-Reduced Models
本文提出了一种基于双教师知识蒸馏的偏差减少场景图生成框架,利用自学习知识缓解视觉基因组(Visual Genome)数据集中不完整且稀疏标注带来的标注偏差。通过训练具有不同归纳偏置的关系分类器——其中一个为另一个提供较少偏差的监督——该方法在平均召回率(mR@100)上实现了最高达+20.4%的显著提升,同时整体召回率(R@100)仅出现轻微下降,优于Motifs和VCTree等最先进模型在所有标准SGG基准上的表现。
Predicting a scene graph that captures visual entities and their interactions in an image has been considered a crucial step towards full scene comprehension. Recent scene graph generation (SGG) models have shown their capability of capturing the most frequent relations among visual entities. However, the state-of-the-art results are still far from satisfactory, e.g. models can obtain 31% in overall recall R@100, whereas the likewise important mean class-wise recall mR@100 is only around 8% on Visual Genome (VG). The discrepancy between R and mR results urges to shift the focus from pursuing a high R to a high mR with a still competitive R. We suspect that the observed discrepancy stems from both the annotation bias and sparse annotations in VG, in which many visual entity pairs are either not annotated at all or only with a single relation when multiple ones could be valid. To address this particular issue, we propose a novel SGG training scheme that capitalizes on self-learned knowledge. It involves two relation classifiers, one offering a less biased setting for the other to base on. The proposed scheme can be applied to most of the existing SGG models and is straightforward to implement. We observe significant relative improvements in mR (between +6.6% and +20.4%) and competitive or better R (between -2.4% and 0.3%) across all standard SGG tasks.
研究动机与目标
- 解决视觉基因组(VG)数据集中因类别不平衡、不完整及稀疏标注导致的场景图生成(SGG)模型偏差问题。
- 通过缓解标注假阴性(aFN)和部分真阳性(aPTP)情况的影响,减少对频繁关系(如'on', 'has')的过度依赖。
- 在不牺牲对频繁关系性能的前提下,提升对罕见和少数类关系的泛化能力。
- 设计一种可轻松集成到现有SGG模型中的训练方案,且仅需极少的架构修改。
提出的方法
- 提出一种双教师知识蒸馏框架,其中一个关系分类器(教师)为另一个(学生)提供较少偏差的预测,以减少对频繁关系的过拟合。
- 使用超球面嵌入空间对关系分类进行正则化,提升在长尾分布上的泛化能力。
- 训练主模型(F)对所有类别进行关系预测,包括将未标注对视为'无关系',而第二个模型(G)则从自标注的、较少偏差的预测中学习。
- 在蒸馏损失中应用温度缩放,以控制学生模型预测的软性程度,平衡多样性与准确性。
- 采用类似协同训练的设置,使两个模型通过未标注和模糊配对的自监督知识联合优化预测。
- 将该方法应用于现有SGG模型(如Motifs、VCTree),无论是否带有图约束,均可实现即插即用的集成。
实验结果
研究问题
- RQ1从较少偏差的教师模型进行知识蒸馏,是否能提升场景图生成中对罕见关系的泛化能力?
- RQ2从未标注和部分标注配对中自学习的知识,能在多大程度上减少SGG模型中的偏差?
- RQ3在超球面空间中进行训练,是否能提升SGG中长尾关系分布下的性能表现?
- RQ4所提方法如何影响整体召回率(R@100)与平均类别召回率(mR@100)之间的权衡?
- RQ5该框架能否在不修改架构的前提下有效应用于现有SGG模型?
主要发现
- 所提出的L2+cKD框架在VCTree基线上实现了mR@100最高+20.4%的相对提升,同时R@100平均仅下降-0.79%。
- 在PrdCls任务中,VCTree L2+cKD在无约束条件下mR@100提升13.02%,在有约束条件下提升11.64%,而R@100最多仅下降-1.21%。
- 在SGCls任务中,该方法相较Motifs基线实现了19.89%的mR@100相对提升,且R@100仅损失-1.3%,可忽略不计。
- 消融实验表明,蒸馏损失中温度T的增加可提升mR@K,但当T过大时会降低R@K,表明多样性与准确性之间存在权衡。
- 模型在少数类(如'on back of', 'lying on')上获得的增益显著高于多数类,证实了对频繁关系的偏差已有效降低。
- 该框架在无约束设置下性能提升最为显著,表明其在不受图结构约束时,具有更强的检索相关关系的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。