Skip to main content
QUICK REVIEW

[论文解读] Open Vocabulary Scene Parsing

Hang Zhao, Xavier Puig|arXiv (Cornell University)|Mar 26, 2017
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出开放词汇场景解析(open vocabulary scene parsing),这是一种新型任务,可利用大规模、开放的物体类别词汇表进行场景分割,超越固定训练集的限制。作者提出一种联合图像像素与词概念嵌入框架,保留层次语义关系(如 WordNet 中的关系),实现零样本泛化、概念检索以及概念的算术组合——在 ADE20K 数据集上实现高性能,且预测结果可解释、结构清晰。

ABSTRACT

Recognizing arbitrary objects in the wild has been a challenging problem due to the limitations of existing classification models and datasets. In this paper, we propose a new task that aims at parsing scenes with a large and open vocabulary, and several evaluation metrics are explored for this problem. Our proposed approach to this problem is a joint image pixel and word concept embeddings framework, where word concepts are connected by semantic relations. We validate the open vocabulary prediction ability of our framework on ADE20K dataset which covers a wide variety of scenes and objects. We further explore the trained joint embedding space to show its interpretability.

研究动机与目标

  • 解决固定词汇量场景解析模型无法泛化到未见物体类别的问题。
  • 实现场景解析中大规模、开放词汇的概念集合,包括训练期间未见的概念。
  • 开发统一框架,保留语义层次结构(如上下位关系)在联合嵌入空间中的表示。
  • 通过概念检索、边界松弛和算术运算探索学习嵌入空间的可解释性。
  • 建立适用于具有固有类别模糊性的开放识别任务的评估指标。

提出的方法

  • 训练深度神经网络,将图像像素特征与知识图谱(如 WordNet)中的词概念联合嵌入到共享的高维向量空间中。
  • 通过基于边距的损失函数优化,确保嵌入空间中上下位关系的语义层次结构得以保持。
  • 使用加权交叉熵损失,通过信息含量考虑类别频率,减少对高频类别的偏差。
  • 通过允许在 WordNet 层次结构的中间节点进行预测,而非仅限于叶节点,实现零样本预测。
  • 在嵌入空间中通过算术运算(如 min/max)实现概念检索、边界松弛和概念合成。
  • 利用 ADE20K 数据集进行训练与评估,借助其丰富的场景标注和多样的物体类别。

实验结果

研究问题

  • RQ1仅依赖知识图谱中的语义知识,场景解析模型能否泛化到训练期间未见的物体类别?
  • RQ2联合图像-概念嵌入空间在在多大程度上能保持层次语义关系(如上下位关系)?
  • RQ3学习到的嵌入空间在多大程度上支持可解释的操作,如概念检索和概念的算术组合?
  • RQ4实现稳健的零样本泛化所需的最少训练类别数量是多少?
  • RQ5不同评估指标在多大程度上能反映具有模糊或层次化标签的开放识别系统的性能?

主要发现

  • 所提出的 Joint-Hyper 模型实现了强大的零样本泛化性能,当训练类别超过 500 个后性能趋于饱和,表明在此规模后收益递减。
  • 该模型成功实现了像素级概念检索,且随着概念抽象程度提高(如 'furniture' 或 'object'),召回率高于 Word2Vec 基线模型。
  • 嵌入空间隐式编码了抽象属性(如 'sittability'),使得即使未显式标注为 'chair',也能检测到支持就坐的区域(如长凳、脚凳)。
  • 嵌入空间中的算术运算可实现有意义的概念合成:max 操作可检索共有的下位词(如 'pool table' 作为 'table' 与 'game equipment' 的交集),min 操作可检索类似并集的概念(如 'cart' 作为 'bicycle' 与 'canopy' 的融合)。
  • 即使对于未见类别,模型也能生成合理且结构化的预测——例如,当 'tricycle' 未在训练集中出现时,模型可预测为 'vehicle',展示了类人的泛化能力。
  • 该框架对不一致的人工标注具有鲁棒性,因为层次结构降低了对具有不同领域知识的标注者所引入的标注噪声的敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。