[论文解读] Zero-Shot Learning with Common Sense Knowledge Graphs
本文提出 ZSL-KG,一种新颖的框架,利用常识知识图谱通过基于 Transformer 的图卷积网络(TrGCN)生成表达性强、非线性的零样本学习类别表征。该方法在视觉与语言任务的六个基准中的五个上优于现有的基于 WordNet 的方法,在 OntoNotes、BBN、aPY、SNIPS-NLU 和 ImageNet 22K 上达到最先进性能。
Zero-shot learning relies on semantic class representations such as hand-engineered attributes or learned embeddings to predict classes without any labeled examples. We propose to learn class representations by embedding nodes from common sense knowledge graphs in a vector space. Common sense knowledge graphs are an untapped source of explicit high-level knowledge that requires little human effort to apply to a range of tasks. To capture the knowledge in the graph, we introduce ZSL-KG, a general-purpose framework with a novel transformer graph convolutional network (TrGCN) for generating class representations. Our proposed TrGCN architecture computes non-linear combinations of node neighbourhoods. Our results show that ZSL-KG improves over existing WordNet-based methods on five out of six zero-shot benchmark datasets in language and vision.
研究动机与目标
- 解决现有零样本学习方法依赖人工设计属性或基于 WordNet 的嵌入所导致的局限性,这些方法耗时费力或具有领域特定性。
- 探索常识知识图谱作为高层次、通用语义知识来源在零样本学习中的未被发掘潜力。
- 开发一种归纳式、通用框架,能够从大规模、无向知识图谱中生成表达性强的类别表征,而无需在训练过程中使用完整图结构。
- 将基于图神经网络的零样本学习方法从物体分类扩展至自然语言理解任务。
- 通过使用基于 Transformer 的聚合器学习节点邻域的非线性、置换不变组合,提升在多样化基准上的零样本学习性能。
提出的方法
- 提出 ZSL-KG,一种通用框架,将常识知识图谱中的节点嵌入向量空间,以生成用于零样本学习的类别表征。
- 引入 TrGCN,一种新颖的基于 Transformer 的图卷积网络,用于计算节点邻域特征的非线性、置换不变组合,从而增强表征的表达能力。
- 在 TrGCN 中采用自注意力机制,动态加权邻近节点特征,实现超越简单平均或最大池化的自适应聚合。
- 设计框架为归纳式,支持在未见过的图和训练期间未出现的测试类别上进行推理,这对广义零样本学习至关重要。
- 利用低秩分解和基分解技术减少关系聚合组件中的参数数量,避免过拟合。
- 对语言任务应用特定任务的 biLSTM 编码器并结合注意力机制,对视觉任务微调 ResNet 主干网络,将其与基于图的类别表征相融合。
实验结果
研究问题
- RQ1常识知识图谱是否能为跨多样化任务的零样本学习提供比 WordNet 更通用、更灵活的语义知识来源?
- RQ2与图神经网络中线性聚合器相比,基于 Transformer 的图卷积网络(TrGCN)是否能显著提升类别表征学习性能?
- RQ3为物体识别设计的基于图的零样本学习框架能否有效适配至自然语言理解任务?
- RQ4ZSL-KG 在视觉与语言零样本基准上相对于最先进基于 WordNet 的方法表现如何?
- RQ5ZSL-KG 的归纳性质在多大程度上实现了对未见类别和图的稳健泛化?
主要发现
- ZSL-KG 在 OntoNotes、BBN、aPY 和 SNIPS-NLU 数据集上的零样本语言理解任务中达到新的最先进性能。
- 在 ImageNet 22K 数据集上,该框架优于现有基于 WordNet 的方法,证明其在大规模视觉基准上的强大泛化能力。
- 在 AWA2 数据集上,ZSL-KG 保持了具有竞争力的性能,证实其在不同零样本学习设置下的鲁棒性。
- 消融研究显示,采用自注意力机制的 TrGCN 组件显著优于线性聚合器(如平均、最大池化)及其他 GNN 变体(如 GCN、GAT、RGCN)。
- 使用常识知识图谱可生成更具表达性和判别力的类别表征,尤其在需要细微语义理解的任务中表现更优。
- ZSL-KG 的归纳性质使其即使在测试类别不属于训练图的情况下,也能实现有效的零样本泛化,验证了其可扩展性与适应性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。