[论文解读] Multi-Knowledge Fusion for New Feature Generation in Generalized Zero-Shot Learning
本文提出了一种新颖的生成式零样本学习方法——多知识融合网络(MKFNet),通过融合多层次知识(如科、属、种)并采用基于遗传策略的自适应新特征生成器(NFG),提升了语义到视觉特征的生成能力。该方法显著缓解了语义不足和域偏移问题,在广义零样本学习与检索基准上性能优于当前最先进方法,适用于多个数据集。
Suffering from the semantic insufficiency and domain-shift problems, most of existing state-of-the-art methods fail to achieve satisfactory results for Zero-Shot Learning (ZSL). In order to alleviate these problems, we propose a novel generative ZSL method to learn more generalized features from multi-knowledge with continuously generated new semantics in semantic-to-visual embedding. In our approach, the proposed Multi-Knowledge Fusion Network (MKFNet) takes different semantic features from multi-knowledge as input, which enables more relevant semantic features to be trained for semantic-to-visual embedding, and finally generates more generalized visual features by adaptively fusing visual features from different knowledge domain. The proposed New Feature Generator (NFG) with adaptive genetic strategy is used to enrich semantic information on the one hand, and on the other hand it greatly improves the intersection of visual feature generated by MKFNet and unseen visual faetures. Empirically, we show that our approach can achieve significantly better performance compared to existing state-of-the-art methods on a large number of benchmarks for several ZSL tasks, including traditional ZSL, generalized ZSL and zero-shot retrieval.
研究动机与目标
- 解决零样本学习中的语义不足问题,即现有方法因语义表征有限或不完整,难以捕捉判别性语义特征。
- 克服域偏移挑战,即已见类与未见类的语义与视觉分布显著分离,影响泛化能力。
- 通过融合多层次知识(如科、属、种)提升特征泛化能力,生成更具代表性与泛化性的视觉特征。
- 通过自适应特征生成机制,提升合成视觉特征与真实未见视觉特征之间的对齐性。
- 通过丰富语义与视觉特征空间,在广义零样本学习与零样本图像检索任务中实现更优性能。
提出的方法
- 提出多知识融合网络(MKFNet),通过可学习融合模块自适应地融合来自多个语义知识层级(科、属、种)的视觉特征,以提升特征泛化能力。
- 引入具有自适应遗传策略的新特征生成器(NFG),通过重加权与重组现有属性生成新且具有判别性的语义特征,增强语义表达能力。
- 采用多损失训练目标:在NFG中使用$L_{ER}$以提升语义特征质量,在自适应遗传策略中使用$L_{NR}$与$L_{KR}$以增加合成特征与真实未见视觉特征之间的交集。
- 在共享语义-视觉嵌入空间中,通过深度神经网络将不同知识层级的语义特征映射至视觉空间,支持端到端训练。
- 通过生成视觉特征与真实未见特征之间的余弦相似度评估检索性能,并选取前5名检索图像进行定性分析。
- 利用注意力机制与受知识图谱启发的聚合方式,丰富语义表征,而无需完全依赖数据集中嵌入的属性。
实验结果
研究问题
- RQ1多层级知识融合(科、属、种)是否能提升零样本学习中视觉特征的泛化能力?
- RQ2通过遗传策略自适应生成新语义特征,是否能增强合成视觉特征的判别能力?
- RQ3所提方法在多大程度上缓解了已见类与未见类之间的域偏移问题?
- RQ4多样化语义知识的融合在多大程度上改善了合成特征与真实未见视觉特征之间的对齐性?
- RQ5所提方法是否能在多个ZSL基准(包括广义ZSL与零样本检索)上实现最先进性能?
主要发现
- 所提MKFNet-NFG方法在CUB、AwA1、AwA2与FLO等多个基准上,于传统ZSL、广义ZSL及零样本检索任务中,性能显著优于当前最先进方法。
- MKFNet中的自适应融合模块在所有数据集中为所有知识层级(科、属、种)分配了非零重要性权重,证实各知识领域均对特征生成有实质性贡献。
- 在AwA1与AwA2数据集上,MKFNet-NFG在几乎每个未见类别上的分类准确率均优于不使用NFG的MKFNet,验证了新特征生成器的有效性。
- 在CUB数据集上的定性检索结果表明,与GAZSL相比,所提方法检索到更多正确图像(绿色框)并更少错误图像(红色框),表明特征对齐性更优。
- 生成视觉中心与真实未见特征之间具有高余弦相似度,验证了模型生成的特征与真实未见视觉特征高度匹配。
- 消融实验表明,多知识融合与自适应特征生成两个组件对性能提升均至关重要,二者共同缓解了语义不足与域偏移问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。