[论文解读] Care about you: towards large-scale human-centric visual relationship detection
本文提出 HCVRD,一个大规模以人类为中心的视觉关系检测数据集,包含 9,852 种关系类别和 18,471 个零样本关系,解决了长尾分布与零样本识别的挑战。提出一种利用网络检索嵌入和度量学习的弱监督方法,以提升零样本泛化能力,在少样本与零样本基准上均达到最先进性能。
Visual relationship detection aims to capture interactions between pairs of objects in images. Relationships between objects and humans represent a particularly important subset of this problem, with implications for challenges such as understanding human behaviour, and identifying affordances, amongst others. In addressing this problem we first construct a large-scale human-centric visual relationship detection dataset (HCVRD), which provides many more types of relationship annotation (nearly 10K categories) than the previous released datasets. This large label space better reflects the reality of human-object interactions, but gives rise to a long-tail distribution problem, which in turn demands a zero-shot approach to labels appearing only in the test set. This is the first time this issue has been addressed. We propose a webly-supervised approach to these problems and demonstrate that the proposed model provides a strong baseline on our HCVRD dataset.
研究动机与目标
- 通过构建一个大规模、细粒度的数据集,包含多样化的类别关系,解决人类-物体关系检测中的长尾分布问题。
- 实现训练过程中未见过的关系的零样本识别,这对实际部署至关重要,因为罕见互动在现实世界中很常见。
- 开发一种可扩展的弱监督方法,利用弱标签的网络数据提升对罕见和未见关系的泛化能力。
- 为未来基于真实、大规模数据的人类中心视觉关系检测研究提供强有力的基线。
提出的方法
- 通过在 Visual Genome 基础上扩展 9,852 个细粒度谓词和 4 个子类别(男性、女性、男孩、女孩)的人类主体,构建 HCVRD,实现对人类-物体交互更细致的建模。
- 利用来自 Google 图像的网络数据,自动收集并丰富罕见和未见关系的训练数据,利用搜索结果的弱监督信号。
- 应用距离度量学习框架,将关系嵌入共享语义空间,通过在网络检索的嵌入上进行最近邻搜索实现零样本预测。
- 引入噪声过滤步骤,提升网络衍生嵌入的质量,降低噪声或无关网络结果的影响。
- 采用两阶段检测流程:首先检测人类和物体的边界框,然后通过与网络嵌入原型的语义相似度预测关系三元组。
- 使用 VGG-16 主干网络进行特征提取,并计算测试样本与关系类别均值嵌入之间的余弦相似度,以执行推理。
实验结果
研究问题
- RQ1一个具有长尾标签分布的大规模、细粒度人类中心视觉关系检测数据集,能否提升视觉关系识别的真实感与实用性?
- RQ2弱监督学习在缓解视觉关系检测中罕见和未见关系的数据稀缺问题方面有多有效?
- RQ3在网络检索嵌入上进行度量学习,能在多大程度上实现人类-物体交互识别中的稳健零样本泛化?
- RQ4网络数据增强、噪声过滤与度量学习在提升零样本性能方面的相对贡献分别是什么?
- RQ5统一框架能否有效处理人类中心视觉关系检测中的少样本与零样本设置?
主要发现
- 在非零样本测试集上,该方法的关系检测性能达到 10.03% R@50 和 13.05% R@100,显著优于基线方法(如 SeparateCNN 的 0.06% 和 0.11% R@50 和 R@100)。
- 在零样本测试集上,该方法在谓词检测上达到 8.15% R@50 和 13.42% R@100,展现出对未见关系的强大泛化能力。
- 消融实验表明,移除度量学习模块导致性能下降最明显(R@50 从 10.03% 降至 5.87%),表明其在语义对齐中的关键作用。
- 噪声过滤的贡献小于度量学习,但仍能提升性能,表明其有助于优化网络数据质量,但并非主要驱动力。
- 完整模型(包含网络数据与度量学习)在关系检测上的 top-1 准确率为 0.59,top-3 准确率为 0.72,优于缺少关键组件的变体。
- 该方法对未见关系具有稳健的泛化能力,性能提升主要归因于利用外部网络数据在语义空间中进行最近邻搜索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。