Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Learning with Knowledge Enhanced Visual Semantic Embeddings

Karan Sikka, Jihua Huang|arXiv (Cornell University)|Nov 21, 2020
Domain Adaptation and Few-Shot Learning参考文献 74被引用 5
一句话总结

该论文提出了一种基于常识的神经符号损失(Common-Sense based Neuro-Symbolic Loss, CSNL),这是一种新颖的神经符号损失函数,通过在视觉-语义嵌入中强制执行常识性逻辑规则(如上下位关系和属性关系)来提升零样本学习(ZSL)性能。通过在组级别应用规则并使用置信度边界实现隐式课程学习,CSNL增强了嵌入空间的可分性,在AWA2和Kinetics-ZS上分别取得了11.5%和11.6%的性能提升,达到当前最先进水平。

ABSTRACT

We improve zero-shot learning (ZSL) by incorporating common-sense knowledge in DNNs. We propose Common-Sense based Neuro-Symbolic Loss (CSNL) that formulates prior knowledge as novel neuro-symbolic loss functions that regularize visual-semantic embedding. CSNL forces visual features in the VSE to obey common-sense rules relating to hypernyms and attributes. We introduce two key novelties for improved learning: (1) enforcement of rules for a group instead of a single concept to take into account class-wise relationships, and (2) confidence margins inside logical operators that enable implicit curriculum learning and prevent premature overfitting. We evaluate the advantages of incorporating each knowledge source and show consistent gains over prior state-of-art methods in both conventional and generalized ZSL e.g. 11.5%, 5.5%, and 11.6% improvements on AWA2, CUB, and Kinetics respectively.

研究动机与目标

  • 通过将常识知识融入深度神经网络的视觉-语义嵌入中,提升零样本学习(ZSL)性能。
  • 解决视觉-语义嵌入(VSE)模型在未见类别上泛化能力差的问题,原因在于嵌入空间中类别级别的区分度不足。
  • 克服先前方法的局限性,这些方法依赖于对VSE形式的复杂修改,或未能有效利用层次化和基于属性的关系。
  • 开发一种神经符号损失,通过置信度边界和组级别规则强制执行实现隐式课程学习,从而提升泛化能力。
  • 评估超类关系和基于属性的规则在提升传统ZSL和广义ZSL设置下性能的有效性。

提出的方法

  • 提出一种新颖的神经符号损失函数——基于常识的神经符号损失(CSNL),将人类可理解的逻辑规则转化为视觉特征上的可微分约束。
  • 通过强制执行如“isA(x, Tiger) → isA(x, Carnivore)”等逻辑规则来正则化VSE空间,确保视觉特征与常识性语义层次结构对齐。
  • 引入组级别规则强制执行机制,即若某一样本与超类(如“Feline”)相似,则其也必须与该超类的所有成员类(如“Tiger”、“Cat”)相似,从而提升结构一致性。
  • 在逻辑算子中引入置信度边界,仅在模型置信度较高时才执行规则,从而实现隐式课程学习,减少过早过拟合。
  • 扩展深度自适应语义逻辑(DASL)以将逻辑规则转化为可微分损失函数,可与标准VSE训练端到端优化。
  • 支持归纳式和归纳外ZSL设置,其中归纳外变体利用未标注的测试数据进一步提升性能。

实验结果

研究问题

  • RQ1将常识知识以逻辑规则形式融入,是否能提升视觉-语义嵌入在零样本学习中的判别能力?
  • RQ2在组级别(如对一个超类集合)强制执行规则,是否比对单个概念强制执行规则能带来更好的泛化性能?
  • RQ3逻辑算子中的置信度边界是否能实现隐式课程学习并防止训练过程中的过拟合?
  • RQ4与最先进方法相比,CSNL在传统ZSL和广义ZSL基准测试中的表现如何?
  • RQ5在归纳外设置中,CSNL是否能有效利用未标注的测试数据进一步提升性能?

主要发现

  • 在AWA2数据集上,CSNL将平均类别准确率(MCA_t)提升了11.5个百分点,达到61.0%,显著优于先前最先进方法(Zhang et al.)的59.9%。
  • 在CUB数据集上,CSNL取得32.5%的MCA_t,较先前最先进方法(SJE)提升13.8%,较基线方法Devise提升10.8%。
  • 在广义ZSL设置(HM指标)下,CSNL_tr(归纳外变体)在AWA2上达到64.0%的HM,显著优于QFSL_tr(42.2%)和Zhang(35.7%),展现出对类别不平衡的强鲁棒性。
  • 在Kinetics-ZS上,CSNL在归纳外设置下取得67.5%的MCA_t和47.0%的HM,较先前最先进方法(Zhang et al.)提升11.6%,较基线方法Devise提升15.6%。
  • 消融实验表明,超类关系和基于属性的规则均对性能提升有贡献,其中组级别规则强制执行机制与置信度边界机制对减少过拟合并提升泛化能力至关重要。
  • CSNL的归纳外变体(CSNL_tr)在所有数据集上均持续优于所有基线方法,表明该方法能有效利用未标注的测试数据来优化嵌入空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。