[论文解读] Weakly-supervised learning of visual relations
本文提出一种仅使用图像级标签的弱监督方法,用于学习物体对之间的视觉关系,利用一种新颖的多模态特征表示,同时编码外观和空间配置信息。该方法在视觉关系检测任务上达到最先进性能,在零样本泛化到未见关系方面显著优于完全监督基线模型,并引入了UnRel数据集以实现对罕见三元组检索的严格评估。
This paper introduces a novel approach for modeling visual relations between pairs of objects. We call relation a triplet of the form (subject, predicate, object) where the predicate is typically a preposition (eg. 'under', 'in front of') or a verb ('hold', 'ride') that links a pair of objects (subject, object). Learning such relations is challenging as the objects have different spatial configurations and appearances depending on the relation in which they occur. Another major challenge comes from the difficulty to get annotations, especially at box-level, for all possible triplets, which makes both learning and evaluation difficult. The contributions of this paper are threefold. First, we design strong yet flexible visual features that encode the appearance and spatial configuration for pairs of objects. Second, we propose a weakly-supervised discriminative clustering model to learn relations from image-level labels only. Third we introduce a new challenging dataset of unusual relations (UnRel) together with an exhaustive annotation, that enables accurate evaluation of visual relation retrieval. We show experimentally that our model results in state-of-the-art results on the visual relationship dataset significantly improving performance on previously unseen relations (zero-shot learning), and confirm this observation on our newly introduced UnRel dataset.
研究动机与目标
- 解决在缺乏或无法获取完整框级标注时,学习物体对之间视觉关系的挑战。
- 通过在相似关系间共享知识,实现在未见视觉关系三元组(主语-谓语-宾语)上的零样本泛化。
- 开发一种弱监督学习框架,仅使用图像级自然语言标签训练关系分类器,避免昂贵的实例级标注。
- 引入一个新的基准数据集UnRel,其对罕见视觉关系进行了详尽标注,以实现对检索和泛化能力的准确评估。
提出的方法
- 该方法使用一种视觉特征表示,结合个体物体的外观特征和物体对之间的空间配置特征,通过可学习的空间变换模块进行编码。
- 将关系分类问题形式化为弱监督学习问题,在仅使用图像级标签(如“人骑自行车”)的情况下训练线性分类器,无需框级标注。
- 采用判别性聚类模型,基于图像级监督为候选物体对分配伪标签,从而实现端到端训练。
- 模型引入一个可学习的“无关系”类别,以在检索过程中提升正负对之间的判别能力。
- 从预训练的目标检测器(如Faster R-CNN)中提取特征,关系特征通过连接或对主语和宾语特征进行注意力机制操作并结合空间上下文信息生成。
- 该框架使用联合嵌入空间,对齐视觉和语言三元组,通过对比学习或基于图像级标签的交叉熵损失进行优化。
实验结果
研究问题
- RQ1当仅使用图像级标签进行训练时,视觉关系识别能否有效泛化到未见三元组(即零样本学习)?
- RQ2当仅可用图像级标注时,弱监督模型相较于完全监督基线模型的性能表现如何?
- RQ3所提出的多模态视觉特征表示在不同空间和外观配置下,对关系检测的性能提升程度如何?
- RQ4一个包含罕见关系详尽标注的新评估数据集(UnRel)是否能够实现对视觉关系检测中零样本泛化能力的可靠基准测试?
主要发现
- 所提出的弱监督模型仅使用图像级监督,在UnRel数据集上达到58.5% mAP,显著优于完全监督的DenseCap基线模型(6.2%)和复现的[31]基线模型(在全监督下为50.6% mAP)。
- 在视觉关系检测数据集上,该模型在使用真实主语和宾语框的情况下达到62.6% mAP,即使在强监督设置下也表现出色。
- 该模型提升了零样本泛化能力,在未见关系的主语/宾语检索任务上达到12.1% mAP,优于完全监督基线模型的10.0%。
- 消融实验表明,若移除“无关系”类别,mAP性能下降3.5%,证实其在判别性对分类中的重要性。
- 图6的定性结果表明,即使在训练过程中未见过此类三元组,模型仍能成功检索出如“人位于床上方”和“圆锥在人头顶”的异常关系的正确物体对。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。