[论文解读] Fine-Grained Scene Graph Generation with Data Transfer
本文提出 IETrans,一种即插即用的数据迁移框架,用于细粒度场景图生成,通过实现内部迁移(将一般谓词重标注为信息量更高的谓词)和外部迁移(从 NA 样本中重标注被遗漏的标注),缓解了长尾分布和语义模糊性问题。该方法在 VG-50 基准上将宏 F1 性能提升一倍,并在新的 1,807 类基准(VG-1800)上达到 SOTA 结果,显著提升了模型的泛化能力和信息量。
Scene graph generation (SGG) is designed to extract (subject, predicate, object) triplets in images. Recent works have made a steady progress on SGG, and provide useful tools for high-level vision and language understanding. However, due to the data distribution problems including long-tail distribution and semantic ambiguity, the predictions of current SGG models tend to collapse to several frequent but uninformative predicates (e.g., on, at), which limits practical application of these models in downstream tasks. To deal with the problems above, we propose a novel Internal and External Data Transfer (IETrans) method, which can be applied in a plug-and-play fashion and expanded to large SGG with 1,807 predicate classes. Our IETrans tries to relieve the data distribution problem by automatically creating an enhanced dataset that provides more sufficient and coherent annotations for all predicates. By training on the enhanced dataset, a Neural Motif model doubles the macro performance while maintaining competitive micro performance. The code and data are publicly available at https://github.com/waxnkw/IETrans-SGG.pytorch.
研究动机与目标
- 解决场景图生成中的长尾分布问题,即大多数谓词类别在训练集中样本极少。
- 解决标注中的语义模糊性问题,即标注者倾向于使用一般谓词(如 'on')而非信息量更高的谓词(如 'riding'),导致模型崩溃。
- 提升模型在细粒度谓词分类中的泛化能力与宏性能,尤其针对罕见和信息量高的关系。
- 开发一种可扩展、与模型无关的数据增强方法,适用于包含超过 1,800 个谓词类别的大规模 SGG。
- 构建一个可靠、人工精心筛选的基准(VG-1800),每个谓词至少有五个测试样本,以确保评估的稳定性。
提出的方法
- 内部迁移利用混淆矩阵识别一般谓词与信息量谓词的配对,并在实例级别将一般谓词的三元组标注迁移至更信息量高的谓词。
- 外部迁移通过模型得分排序识别 NA(负样本或未标注)样本中被遗漏的正向关系,并将其重标注为信息量高的谓词。
- 该方法以即插即用方式运行,兼容多种基线模型(如 Neural Motif),无需修改网络架构。
- 超参数 $k_I$ 控制内部迁移中被迁移的一般谓词比例,而 $k_E$ 控制外部重标注的前-$k_E$ 个 NA 样本。
- 通过将原始标注与迁移及重标注的关系相结合,构建增强数据集,改善数据分布与一致性。
- 该框架在标准 VG-50 基准和新提出的更具挑战性的 1,807 类 VG-1800 基准上进行评估。
实验结果
研究问题
- RQ1从一般谓词向信息量谓词进行内部数据迁移,能否减轻因语义模糊性导致的模型崩溃?
- RQ2从 NA 样本中进行外部数据迁移,能否提升低资源、尾部谓词类别的性能?
- RQ3结合内部与外部迁移后,其在宏 F1 和准确率上的表现相比单一模块提升程度如何?
- RQ4该方法在包含 1,807 个谓词类别的大规模 SGG 上是否具备良好的可扩展性,且性能是否稳定?
- RQ5由 IETrans 生成的增强数据集能否在保持视觉保真度和语义正确性的前提下,提升模型泛化能力?
主要发现
- 在 VG-50 基准上,IETrans 将 Neural Motif 模型的 mR@100 性能提升一倍,在与模型无关的方法中达到 SOTA 性能。
- 在包含 1,807 个谓词类别的新 VG-1800 基准上,IETrans 实现了对 467 个类别的正确预测,优于所有基线方法。
- 消融实验表明,结合内部与外部迁移可获得最高 mAcc,其中仅使用内部迁移已显著提升性能,而外部增强迁移进一步带来增益。
- 内部迁移的最优 $k_I$ 为 80%,超过此值性能下降,原因可能是过度迁移了模糊或错误的关系。
- 外部迁移在重新标注最后 10% 的 NA 样本(按模型置信度排序)时表现出显著性能提升,表明高质量的被遗漏关系通常位于置信度分布的尾部。
- 可视化结果表明,IETrans 生成了更具信息量且语义更准确的关系(如 'sewn onto' 而非 'on'),同时保持了图像保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。