[论文解读] Dual-Glance Model for Deciphering Social Relationships
本文提出一种双重视觉模型用于静态图像中的社会关系识别,采用两阶段注意力机制:首先聚焦于目标人物对进行粗略预测,然后通过注意力RCNN利用上下文区域进行结果优化。主要贡献在于提出了PISC数据集——包含22,670张图像和76,568个标注的社会关系——并实现了基于注意力引导的上下文推理的最先进性能。
Since the beginning of early civilizations, social relationships derived from each individual fundamentally form the basis of social structure in our daily life. In the computer vision literature, much progress has been made in scene understanding, such as object detection and scene parsing. Recent research focuses on the relationship between objects based on its functionality and geometrical relations. In this work, we aim to study the problem of social relationship recognition, in still images. We have proposed a dual-glance model for social relationship recognition, where the first glance fixates at the individual pair of interest and the second glance deploys attention mechanism to explore contextual cues. We have also collected a new large scale People in Social Context (PISC) dataset, which comprises of 22,670 images and 76,568 annotated samples from 9 types of social relationship. We provide benchmark results on the PISC dataset, and qualitatively demonstrate the efficacy of the proposed model.
研究动机与目标
- 解决在静态图像中识别社会关系的挑战,这是实现更高级别社会场景理解的关键步骤。
- 通过建模超越物理外观的细微、高层次社会线索,克服现有视觉关系识别方法的局限性。
- 开发一种受生物视觉启发的视觉模型,通过两个不同阶段的注视(glance)模拟人类视觉注意机制:第一阶段关注目标对,第二阶段关注上下文区域。
- 提供一个大规模、公开可用的基准数据集,以支持未来社会关系分析的研究。
- 通过整合局部人物对特征与全局上下文线索,实现更准确且可解释的社会场景理解。
提出的方法
- 提出双重视觉架构:第一阶段通过区域提议网络(RPN)提取目标人物对的特征,第二阶段通过注意力机制关注上下文区域以实现结果优化。
- 引入注意力RCNN,结合自底向上与自顶向下注意力机制,根据与目标对的相关性动态加权相关上下文区域。
- 采用视觉词袋方法,结合最大池化、平均池化和LSE池化函数,聚合来自多个上下文区域的特征。
- 应用非极大值抑制(NMS)以减少冗余区域提议,并通过调优超参数(m=30个提议区域,τu=0.7重叠阈值)实现最佳性能。
- 在PISC数据集上使用交叉熵损失端到端训练模型,包含9种子社会关系类别和66个职业标签。
- 借鉴关系模型理论,定义社会关系的分层分类体系,包括亲密关系(如家庭、情侣)、非亲密关系(如职业、商业关系)以及非关系类别。
实验结果
研究问题
- RQ1如何通过结合局部人物对特征与上下文线索,使视觉模型有效识别静态图像中的社会关系?
- RQ2注意力机制在选择与目标对相关联的上下文区域方面有何影响,能否提升社会关系识别性能?
- RQ3在融合多个上下文区域特征时,不同聚合函数(最大池化、平均池化、LSE池化)的表现如何?
- RQ4双重视觉机制在社会关系识别任务中,相较于单注意力或非注意力基线模型,优势有多大?
- RQ5像PISC这样大规模、人工标注的数据集,能否支持可靠基准测试并实现社会场景理解的泛化能力?
主要发现
- 采用注意力机制的双重视觉模型在PISC数据集的6类关系子集上达到79.7%的mAP,显著优于非注意力基线模型。
- 使用LSE池化结合注意力机制时性能最佳(mAP为79.7%),表明对相关区域进行软加权聚合可提升推理准确性。
- 在3类关系子集上,加入注意力机制的模型达到76.9%的mAP,而无注意力机制时为71.7%,表明上下文注意力带来稳定性能提升。
- 最优性能在30个区域提议和0.7的提议与目标对重叠阈值下实现,表明区域筛选策略有效。
- 可视化结果表明,注意力机制能动态聚焦于语境相关线索——如家庭关系关注电视、朋友关系关注游戏手柄、职业关系关注白板——展示了模型的可解释性。
- 尽管性能优异,模型仍因线索模糊而偶尔出现误分类(例如,因距离或着装相似而将朋友误判为情侣)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。