[论文解读] Generative Adversarial Zero-shot Learning via Knowledge Graphs
本文提出KG-GAN,一种利用知识图谱(KG)的双重视角——类别分类体系与属性注释——来增强未见类别特征合成的生成式零样本学习框架。通过使用图神经网络(GNNs)从KG中学习语义丰富的类别嵌入,KG-GAN利用标准生成对抗网络(GAN)生成高质量视觉特征,在无需额外正则化的情况下,超越了最先进方法,在ZSL的ImNet-A上达到39.24%的Hit@1,在GZSL中达到30.60%。
Zero-shot learning (ZSL) is to handle the prediction of those unseen classes that have no labeled training data. Recently, generative methods like Generative Adversarial Networks (GANs) are being widely investigated for ZSL due to their high accuracy, generalization capability and so on. However, the side information of classes used now is limited to text descriptions and attribute annotations, which are in short of semantics of the classes. In this paper, we introduce a new generative ZSL method named KG-GAN by incorporating rich semantics in a knowledge graph (KG) into GANs. Specifically, we build upon Graph Neural Networks and encode KG from two views: class view and attribute view considering the different semantics of KG. With well-learned semantic embeddings for each node (representing a visual category), we leverage GANs to synthesize compelling visual features for unseen classes. According to our evaluation with multiple image classification datasets, KG-GAN can achieve better performance than the state-of-the-art baselines.
研究动机与目标
- 解决传统辅助信息(如文本或属性)在零样本学习(ZSL)中语义丰富度有限的问题。
- 通过引入知识图谱(KGs)中的结构化、多方面语义,提升ZSL中的泛化能力与判别能力。
- 开发一种生成式ZSL框架,利用KG嵌入,且不依赖复杂的正则化或网络结构修改。
- 证明来自KG的丰富类别语义可超越精心设计的正则化方法,在生成高质量视觉特征方面表现更优。
提出的方法
- 构建一个双重视角知识图谱(KG),为每个视觉类别整合类别层次结构(类别视图)与属性注释(属性视图)。
- 使用图自编码器结合GNN,从KG的两个视图中学习语义有意义的节点嵌入,同时融合类别名称的词向量。
- 将学习到的KG嵌入输入标准生成对抗网络(GAN),以合成未见类别的判别性视觉特征。
- 以端到端方式训练GAN,将KG嵌入作为条件输入,引导特征生成过程。
- 在ZSL和广义ZSL(GZSL)设置下,使用最近邻分类方法评估生成特征的性能。
- 比较KG-GAN在单独使用视图嵌入(类别或属性)及其组合时的性能,评估其互补性。
实验结果
研究问题
- RQ1与单一来源的辅助信息相比,整合多种语义方面(分类体系与属性)的知识图谱是否能提升零样本学习性能?
- RQ2从KG的不同视图(类别层次结构与属性)中学习到的类别嵌入,在ZSL中的特征合成中分别起到何种作用?
- RQ3KG中丰富的语义信息是否能超越工程化正则化方法,在生成式ZSL模型中发挥更优效果?
- RQ4属性视图与类别视图的嵌入在生成未见类别的判别性特征方面,其互补性在多大程度上体现?
- RQ5当条件输入为KG嵌入时,简单的GAN架构是否能在ZSL中超越更复杂的正则化GAN?
主要发现
- KG-GAN在ImNet-A上达到39.24%的Hit@1,在ImNet-O的广义ZSL中达到30.60%,优于最先进方法。
- 仅使用属性视图KG嵌入(GA)在ZSL的ImNet-A上达到36.82%的Hit@1,优于类别视图嵌入(GC)的32.95%,表明属性提供更具判别性的语义信息。
- 结合类别视图与属性视图嵌入(GC+GA)取得最佳性能,证实二者具有互补性。
- KG-GAN在不使用任何正则化的情况下,仍超越了采用复杂正则化方法(如视觉原型或灵魂样本正则化)的基线模型,表明语义信息的重要性超过正则化设计。
- 消融实验表明,属性视图的贡献大于类别视图,尤其在细粒度分类中,仅靠分类体系难以区分相似类别(如马与斑马)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。