[论文解读] Semantic Compositional Learning for Low-shot Scene Graph Generation
本文提出一种语义组合学习策略,以解决少样本和零样本场景图生成中的数据稀缺问题。该方法通过将关系三元组分解为关键与非关键成分,再利用语义或视觉上相似的物体组合生成新的、逼真的三元组。该方法在三个 SGG 基准上显著提升性能,平均在检索指标上超越当前最先进模型近 50%。
Scene graphs provide valuable information to many downstream tasks. Many scene graph generation (SGG) models solely use the limited annotated relation triples for training, leading to their underperformance on low-shot (few and zero) scenarios, especially on the rare predicates. To address this problem, we propose a novel semantic compositional learning strategy that makes it possible to construct additional, realistic relation triples with objects from different images. Specifically, our strategy decomposes a relation triple by identifying and removing the unessential component and composes a new relation triple by fusing with a semantically or visually similar object from a visual components dictionary, whilst ensuring the realisticity of the newly composed triple. Notably, our strategy is generic and can be combined with existing SGG models to significantly improve their performance. We performed a comprehensive evaluation on the benchmark dataset Visual Genome. For three recent SGG models, adding our strategy improves their performance by close to 50\%, and all of them substantially exceed the current state-of-the-art.
研究动机与目标
- 解决场景图生成中的数据稀缺问题,尤其针对少样本和零样本场景下罕见和未见谓词的问题。
- 克服现有模型仅依赖标注训练三元组的局限,难以处理罕见关系的问题。
- 在无需额外标注的情况下,实现对罕见和未见关系三元组的有效学习。
- 开发一种通用的、与模型无关的策略,可无缝集成至现有 SGG 框架中以提升性能。
- 通过基于语义和视觉相似性的组合方法,提升零样本关系检测能力。
提出的方法
- 基于谓词对整体三元组影响的相对重要性,将关系三元组 $<$s, p, o$>$ 分解为关键成分(如主语和谓词)与非关键成分(如宾语)。
- 构建一个视觉组件词典,包含各类物体类别的多样化实例,作为组合的候选对象。
- 使用相似性度量方法,从词典中选择语义或视觉上相似的物体,以替换非关键成分。
- 通过将关键成分与所选对象实例融合,生成新的关系三元组,确保其逼真性。
- 将该组合策略作为数据增强技术,独立于主 SGG 模型的特征学习机制运行。
- 同时应用类内(同一类别)和类间(语义相似类别)组合,以生成多样且逼真的罕见和未见关系训练样本。
实验结果
研究问题
- RQ1一种与模型无关的策略是否能通过生成逼真的额外训练三元组,提升少样本和零样本场景图生成性能?
- RQ2语义与视觉组合在缓解场景图生成中罕见谓词的数据稀缺问题方面有多有效?
- RQ3与现有方法相比,组合学习在少样本和零样本关系检索任务中的性能提升程度如何?
- RQ4所提出的基于相似性的替换对象选择方法是否能保持逼真性,并提升未见关系场景下的泛化能力?
- RQ5该组合策略是否能与现有 SGG 模型无缝集成,并在不同架构上实现一致的性能提升?
主要发现
- 所提出的 DeC(语义组合学习)策略在三个 SGG 基准(RR、FR、ZR)上相较当前最先进模型,平均性能提升近 50%。
- 在罕见谓词任务(PredCls)中,应用于 Motifs 模型时,mR@50/100 达到 35.7/38.6,显著优于此前最佳模型 TDE(13.2/17.1)。
- 在零样本关系检索(ZR)任务中,该方法将最佳基线模型(TDE)的 mR@50/100 从 13.2/17.1 提升至 13.6/16.5,展现出对未见关系的强大泛化能力。
- 消融实验表明,类内与类间组合均带来正向贡献,其中类内组合在少样本设置下更有效,类间组合在零样本设置下更优。
- 将基于相似性的选择替换为随机选择后,所有任务性能均下降,证明了所提相似性度量的必要性。
- 该方法在三个近期 SGG 模型上,于所有三项评估任务——关系检索(RR)、少样本关系检索(FR)和零样本关系检索(ZR)——中均达到最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。