[论文解读] RelTR: Relation Transformer for Scene Graph Generation
该论文提出 RelTR,一种基于 Transformer 编码器-解码器架构的一阶段端到端场景图生成模型,仅通过视觉外观直接预测一组固定数量的主语-谓词-宾语三元组。通过利用耦合的主语和宾语查询,并采用基于 IoU 的二分图匹配设置预测损失,RelTR 在 Visual Genome、Open Images V6 和 VRD 上实现了最先进性能,且推理速度更快、参数量更少,优于两阶段方法。
Different objects in the same scene are more or less related to each other, but only a limited number of these relationships are noteworthy. Inspired by DETR, which excels in object detection, we view scene graph generation as a set prediction problem and propose an end-to-end scene graph generation model RelTR which has an encoder-decoder architecture. The encoder reasons about the visual feature context while the decoder infers a fixed-size set of triplets subject-predicate-object using different types of attention mechanisms with coupled subject and object queries. We design a set prediction loss performing the matching between the ground truth and predicted triplets for the end-to-end training. In contrast to most existing scene graph generation methods, RelTR is a one-stage method that predicts a set of relationships directly only using visual appearance without combining entities and labeling all possible predicates. Extensive experiments on the Visual Genome and Open Images V6 datasets demonstrate the superior performance and fast inference of our model.
研究动机与目标
- 解决两阶段场景图生成方法在预测所有物体提议对之间密集关系时效率低下且参数量过高的问题。
- 实现仅基于视觉外观的直接、端到端稀疏且有意义的场景图预测,无需依赖预标注的物体提议或对所有可能配对进行详尽的谓词分类。
- 设计一种基于 IoU 匹配的集合预测损失,以在训练期间将预测三元组与真实标签对齐。
- 通过在三元组解码器中采用解耦的实体注意力机制,提升主语和宾语的定位与分类性能。
- 证明仅依赖视觉信息的一阶段方法可在实现最先进性能的同时,实现更快的推理速度和更低的模型复杂度。
提出的方法
- RelTR 采用编码器-解码器 Transformer 架构,其中编码器处理视觉特征,解码器使用耦合的主语和宾语查询生成固定大小的三元组集合。
- 三元组解码器利用多头注意力机制,推理全局图像上下文以及实体之间的共现关系,从而实现主语、宾语和谓词的联合预测。
- 提出一种新颖的集合预测损失,通过交并比(IoU)执行真实三元组与预测三元组之间的二分图匹配,以分配最优预测结果。
- 解耦的实体注意力机制通过分别关注主语和宾语表示,提升了主语和宾语的定位与分类性能。
- 模型仅使用视觉外观进行端到端训练,无需依赖预标注的物体提议或对所有可能配对的关系标签。
- 该框架实现简单,已公开发布代码和预训练模型。
实验结果
研究问题
- RQ1能否仅通过视觉外观,无需依赖两阶段检测流程,实现基于 Transformer 的一阶段端到端模型直接生成稀疏且有意义的场景图?
- RQ2基于 IoU 的二分图匹配策略在训练期间将真实三元组分配给模型预测时,效果如何?
- RQ3采用耦合主语和宾语查询并结合解耦注意力机制,在场景图生成中对定位和关系预测的提升程度如何?
- RQ4在准确率、推理速度和参数效率方面,仅依赖视觉信息的一阶段方法是否优于现有的两阶段 SGG 模型?
- RQ5所学习的主语和宾语查询行为如何?它们在捕捉相关关系中扮演什么角色?
主要发现
- RelTR 在 Visual Genome、Open Images V6 和 VRD 数据集上均达到最先进性能,其准确率和推理速度均优于现有两阶段模型。
- 在 Visual Genome 上,RelTR 在 9 个预测结果下的平均召回率达到 41.7%(R@9),定性结果表明其能正确预测低频空间关系(如“在……前面”)。
- 尽管存在部分真实标注偏差(如缺失或重复三元组),RelTR 仍保持强劲性能,表明其对数据集噪声具有鲁棒性。
- 在 Open Images V6 上,模型生成了高质量且置信度高的三元组提案,该数据集中平均仅含 2.8 个三元组/张图像,证明其在更简单、大规模场景下的强大泛化能力。
- 通过解耦的实体注意力机制,RelTR 显著提升了定位与分类性能,独立增强了主语和宾语表示的质量。
- 消融研究证实,基于 IoU 匹配的集合预测损失对性能至关重要,且注意力图可直观解释模型行为,突出显示相关图像区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。