[论文解读] Graph Edit Distance Reward: Learning to Edit Scene Graph
本文提出一种基于图编辑距离(GED)的奖励机制,用于训练神经符号模型,以根据文本编辑图像检索中的自然语言指令学习编辑场景图。通过结合基于GED的密集奖励进行策略梯度优化,该模型在CSS和新提出的CRIR数据集上均优于现有方法,在复杂、多跳推理场景中展现出更优的泛化能力和准确性。
Scene Graph, as a vital tool to bridge the gap between language domain and image domain, has been widely adopted in the cross-modality task like VQA. In this paper, we propose a new method to edit the scene graph according to the user instructions, which has never been explored. To be specific, in order to learn editing scene graphs as the semantics given by texts, we propose a Graph Edit Distance Reward, which is based on the Policy Gradient and Graph Matching algorithm, to optimize neural symbolic model. In the context of text-editing image retrieval, we validate the effectiveness of our method in CSS and CRIR dataset. Besides, CRIR is a new synthetic dataset generated by us, which we will publish it soon for future use.
研究动机与目标
- 为解决在跨模态图像检索中根据用户提供的文本指令学习编辑场景图的空白问题。
- 通过引入基于图编辑距离(GED)的更精确、密集的奖励信号,改进神经符号模型中粗粒度的0/1奖励机制。
- 构建一个新的合成数据集CRIR,以支持复杂、多跳推理任务,并减少对精确空间位置约束的依赖。
- 通过将图像编辑转化为符号化场景图编辑并结合神经程序生成,实现更具泛化性和可解释性的图像检索。
- 验证基于GED的奖励在提升简单与复杂查询类型下模型性能方面的有效性。
提出的方法
- 提出一种图编辑距离(GED)奖励函数,量化预测场景图与目标场景图之间的差异,包含节点插入/删除以及属性/边替换的代价。
- 将GED奖励集成至策略梯度框架中,微调一个神经程序生成器,以生成对场景图进行符号化编辑操作(如添加、删除、修改)的程序。
- 设计一个场景图生成引擎,将图像解析为符号化表示,包含节点(对象)和边(关系),以支持结构化推理。
- 实现一个修改引擎,将程序输出应用于更新场景图,包括添加带完整边连接的伪节点,以及移除包含所有关联边的节点。
- 使用序列到序列(seq2seq)程序生成器从输入文本预测潜在程序,通过填充进行长度归一化,以处理可变长度指令。
- 采用早停策略与批量训练,固定批量大小为64,共训练60,000轮,利用GED奖励优化程序生成器。
实验结果
研究问题
- RQ1基于图编辑距离的密集可微分奖励是否能相比二值0/1奖励,更有效地提升场景图编辑的学习效果?
- RQ2所提出方法在处理不依赖精确空间位置的复杂多跳推理查询时,效果如何?
- RQ3基于GED的奖励是否能带来更好的泛化能力,并在未见的复杂图像检索任务中提升性能?
- RQ4该模型是否能超越对空间约束严格的基准数据集(如CSS),在更具现实性的关系型场景图场景中实现泛化?
- RQ5所提出的CRIR数据集在多大程度上支持对文本编辑图像检索中高级推理与编辑能力的评估?
主要发现
- 所提模型结合GED奖励在CSS和CRIR数据集上均达到最先进性能,超越TIRG和Concat模型在所有查询类型上的表现。
- 在CRIR数据集上,该模型在复杂的三跳查询中仍保持高性能,而TIRG和Concat模型显著失效。
- GED奖励显著提升了学习效率与准确性,如表2后两列所示,表明模型与目标图的对齐程度更高。
- 在涉及关系编辑的定性案例中(如在另一对象左侧添加一个对象),该模型能成功检索正确图像,而TIRG仅基于视觉相似性检索,导致失败。
- CRIR数据集使用CLEVR工具包生成,通过去除精确位置约束,有效模拟了现实世界复杂性,支持多跳推理。
- 该模型在关系编辑任务中展现出强大的泛化能力,优于依赖特征级融合或简单奖励机制的基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。