Skip to main content
QUICK REVIEW

[论文解读] Using Sentences as Semantic Representations in Large Scale Zero-Shot Learning

Yannick Le Cacheux, Hervé Le Borgne|arXiv (Cornell University)|Oct 6, 2020
Domain Adaptation and Few-Shot Learning参考文献 31被引用 5
一句话总结

本文提出在大规模零样本学习(ZSL)中使用简短的自然语言句子作为语义原型,通过学习的视觉性加权方法将这些句子与类别名称嵌入相结合,显著提升性能。通过利用FastText嵌入和注意力机制,优先关注句子中与视觉相关的关键词汇,该方法在ImageNet ZSL上实现了17.8%的SOTA(最先进)top-1准确率,优于仅使用词嵌入或属性的先前方法。

ABSTRACT

Zero-shot learning aims to recognize instances of unseen classes, for which no visual instance is available during training, by learning multimodal relations between samples from seen classes and corresponding class semantic representations. These class representations usually consist of either attributes, which do not scale well to large datasets, or word embeddings, which lead to poorer performance. A good trade-off could be to employ short sentences in natural language as class descriptions. We explore different solutions to use such short descriptions in a ZSL setting and show that while simple methods cannot achieve very good results with sentences alone, a combination of usual word embeddings and sentences can significantly outperform current state-of-the-art.

研究动机与目标

  • 解决传统零样本学习(ZSL)方法在依赖人工定义属性或通用词嵌入时面临的可扩展性和性能限制。
  • 探究简短、自然语言句子是否可作为大规模ZSL中未见类别有效且可扩展的语义表征。
  • 开发一种轻量化、计算高效的模型,将句子描述与类别名称嵌入相结合,以提升语义原型的质量。
  • 将高质量、预训练的基于句子的原型公开发布,供ZSL及相关任务使用。

提出的方法

  • 该方法使用线性岭回归模型(Linear S→V)将语义原型从语义空间映射到视觉特征空间,学习一个变换矩阵 Θ 以对齐视觉与语义特征。
  • 通过结合类别名称和简短描述性句子(例如:'一种体型大、黑色、具有长喙的鸟')构建语义原型,使用FastText嵌入表示词语。
  • 为句子中的每个词语计算视觉性得分,定义为该词语对应图像平均视觉特征的平均距离的倒数,以识别在语义和视觉上均相关的术语。
  • 在句子嵌入上应用注意力机制,利用学习到的权重突出视觉性高的词语,从而改善语义空间与视觉空间之间的对齐。
  • 最终原型通过类别名称嵌入与句子嵌入的加权组合形成,通过交叉验证确定最优比例为70%句子和30%类别名称。
  • 该方法在多个ZSL模型(如ESZSL、ConSE、DeViSE)上进行评估,结果表明使用所提出的句子增强原型可实现一致性的性能提升。

实验结果

研究问题

  • RQ1简短的自然语言句子能否在大规模零样本学习中作为有效且可扩展的语义表征?
  • RQ2与仅使用词嵌入或属性相比,将基于句子的描述与类别名称嵌入结合,对ZSL性能有何影响?
  • RQ3将句子内容整合到语义原型中的最佳方式是什么——具体而言,句子中哪些词语最能预测视觉特征?
  • RQ4使用视觉性加权注意力是否能改善ZSL中语义空间与视觉空间之间的对齐?
  • RQ5所提出的方法是否能在无需微调或复杂架构的情况下,在ImageNet等大规模基准上实现SOTA性能?

主要发现

  • 在使用Linear S→V模型时,该方法在ImageNet ZSL上实现了17.8%的top-1准确率,显著优于先前的SOTA方法。
  • 类别名称与句子嵌入结合视觉性加权注意力(Classname+Def visualness+Parent)的组合表现最佳,70%句子与30%类别名称的比例为最优权衡。
  • FastText嵌入在所提框架中始终优于其他词嵌入方法,包括GloVe和ELMo。
  • 尽管ELMo具备上下文建模能力,但其性能表现较差,表明在结合视觉性评分时,上下文词表示可能并非ZSL的最优选择。
  • 该方法在不同ZSL模型上具有良好的泛化能力,使用所提出的句子增强原型后,top-1、top-5和top-10准确率均实现一致提升。
  • 作者公开发布了预训练的基于句子的原型及代码,使未来ZSL与跨模态学习研究可立即使用并实现可复现性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。