[论文解读] Improving Zero Shot Learning Baselines with Commonsense Knowledge
本文通过在图卷积自编码器中整合ConceptNet的常识知识,提升零样本学习(ZSL)基线模型,生成更优的语义嵌入。通过将这些常识嵌入与人类定义的属性(HA)及分布式词嵌入(DWE)融合,该方法在三个基准数据集上均实现显著的准确率提升,表明显式关系知识可超越标准语义嵌入,增强零样本泛化能力。
Zero shot learning -- the problem of training and testing on a completely disjoint set of classes -- relies greatly on its ability to transfer knowledge from train classes to test classes. Traditionally semantic embeddings consisting of human defined attributes (HA) or distributed word embeddings (DWE) are used to facilitate this transfer by improving the association between visual and semantic embeddings. In this paper, we take advantage of explicit relations between nodes defined in ConceptNet, a commonsense knowledge graph, to generate commonsense embeddings of the class labels by using a graph convolution network-based autoencoder. Our experiments performed on three standard benchmark datasets surpass the strong baselines when we fuse our commonsense embeddings with existing semantic embeddings i.e. HA and DWE.
研究动机与目标
- 为解决零样本学习中的挑战——即模型必须在无训练数据的情况下对未见类别进行分类——通过外部知识提升语义嵌入质量。
- 探究常识知识(而非仅词汇或层级关系)是否能增强ZSL中已见类别与未见类别之间的可迁移性。
- 开发一种基于图的方法,从ConceptNet中学习有意义的关系嵌入,以支持更优的视觉-语义关联。
- 通过将常识感知表示集成到标准训练流程中,超越现有的强ZSL基线模型。
提出的方法
- 在完整的ConceptNet知识图谱上训练基于图卷积网络(GCN)的自编码器,以学习类别间的关联并生成常识嵌入(CSE)。
- 通过在ConceptNet的节点间传递消息,对类别标签之间的关系路径进行编码,捕捉超越词共现关系的非平凡语义连接。
- 将常识嵌入与两种标准语义嵌入类型融合:人类定义的属性(HA)和分布式词嵌入(DWE),如word2vec。
- 将融合后的嵌入用于标准ZSL框架中,通过关联函数将视觉特征与语义嵌入匹配,以预测最相似的类别。
- 从ConceptNet中为所有已见和未见类别构建子图,以确保模型在嵌入学习过程中捕捉每种类别的相关关系上下文。
- 在标准ZSL协议下进行评估,采用不相交的已见与未见类别划分,并以top-1准确率为首要指标。

实验结果
研究问题
- RQ1来自ConceptNet等知识图谱的常识知识是否能超越传统语义嵌入,提升零样本学习性能?
- RQ2与WordNet等词汇知识图谱相比,ConceptNet中的关系知识在ZSL中的整合效果如何?
- RQ3在ConceptNet上训练的图自编码器是否能生成比标准词嵌入更具区分性与可迁移性的未见类别嵌入?
- RQ4已见类别与未见类别之间显式的关系路径在多大程度上增强了视觉-语义关联?
- RQ5所提出的方法在具有不同领域分布的多样化数据集上是否具有鲁棒性?
主要发现
- 将常识嵌入(CSE)与人类定义的属性(HA)及分布式词嵌入(DWE)融合,可在所有三个基准数据集上实现一致且显著的准确率提升。
- 该方法显著超越强基线模型(包括Wang et al. (2018)),证明了所提出的图自编码器方法的优越性。
- 当用WordNet替代ConceptNet时,性能显著下降,证实常识关系(如'RelatedTo'、'CapableOf')比词汇关系(如'Hypernym')在ZSL中更具有效性。
- 模型在领域特定数据集(如仅动物类)上的准确率高于在更广泛的数据集(如aP&Y)上的表现,表明领域同质性有助于提升可迁移性。
- 定性分析显示,即使在视觉和语义上相似的类别(如'Jetski'与'Motorbike')之间,word2vec相似度也较低(0.45),但其常识关系较强,而模型能有效利用这些关系。
- 常识嵌入通过捕捉标准嵌入所遗漏的间接关系知识,实现了对视觉特征与未见类别标签之间更好关联。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。