Skip to main content
QUICK REVIEW

[论文解读] Distributional Modeling on a Diet: One-shot Word Learning from Text Only

Su Wang, Stephen Roller|arXiv (Cornell University)|Apr 14, 2017
Topic Modeling参考文献 23被引用 12
一句话总结

本文提出了一种贝叶斯分布模型,通过利用总体结构知识——特别是句法上下文中的规律性以及定义性属性之间的共现模式——实现了仅从文本中单次示例即可完成词汇学习。该模型在仅凭单个句子预测词汇属性方面表现出显著性能,对于分类属性的平均精度(AP)达到0.62,表明信息丰富的上下文和结构化先验知识能极大提升分布语义中的快速映射能力。

ABSTRACT

We test whether distributional models can do one-shot learning of definitional properties from text only. Using Bayesian models, we find that first learning overarching structure in the known data, regularities in textual contexts and in properties, helps one-shot learning, and that individual context items can be highly informative. Our experiments show that our model can learn properties from a single exposure when given an informative utterance.

研究动机与目标

  • 探究分布模型是否能够仅从单一文本上下文中实现对定义性词汇属性的单次学习,以模拟人类的快速映射能力。
  • 考察总体结构知识(如上下文规律性和属性共现模式)在实现高效单次学习中的作用。
  • 评估单个上下文项目在单次暴露设置下预测未知词汇意义的有用性。
  • 开发并测试一种概率框架,整合关于上下文和属性结构的先验知识,以提升单次推理性能。

提出的方法

  • 该模型使用贝叶斯推理,从包含未知词汇的单个句子中进行学习,通过句法上下文的分布表示将词汇映射到定义性属性。
  • 它整合了两种总体结构:(1) 上下文项的规律性(例如,'eat-dobj' 和 'cook-dobj' 倾向于使用相似的填充词),以及 (2) 属性之间的共现模式(例如,'mammal' 和 'four-legged' 经常共现)。
  • 该模型结合了两个组件:基于上下文的模型(TM)和属性共现模型(PM),并引入一个混合模型(bi-TM)以整合两者。
  • 通过三种度量方式评估上下文项的有用性:频率、熵以及在已见角色填充词上属性分布的平均余弦相似度(AvgCos)。
  • 该模型在两个数据集上进行评估:Quantified McRae(QMR)数据集和Animal数据集,使用平均精度(AP)和平均平均精度(MAP)作为评估指标。
  • 表现最佳的模型(bi-TM)同时利用了上下文和属性结构,其中AvgCos被证明是最可靠的上下文有用性预测指标。

实验结果

研究问题

  • RQ1分布模型能否仅从单一文本上下文中实现对定义性词汇属性的单次学习?
  • RQ2学习上下文中的总体规律性(如选择性约束)是否能提升单次词汇学习性能?
  • RQ3学习属性之间的共现模式是否能增强对未知词汇意义的单次推理?
  • RQ4哪些上下文项对单次学习最具信息量,且能否通过可度量的标准自动选择?

主要发现

  • bi-TM模型(结合上下文规律性和属性共现模式)表现最佳,在Animal数据集上对分类属性的平均平均精度(MAP)达到0.62。
  • 基于角色填充词上属性分布的平均余弦相似度(AvgCos)的上下文有用性度量,成为最稳健的有用上下文预测指标,优于频率和熵。
  • 在QMR数据集上,模型对功能属性的MAP为0.45,对分类属性为0.62,对视觉属性为0.34,表明分类和功能属性最易从上下文中推断。
  • 即使仅经历一次暴露,该模型在由AvgCos选出的最佳上下文上的表现也接近多实例模型,表明上下文选择可显著降低数据需求。
  • 该模型在干净、精心整理的Animal数据集上的表现显著优于噪声更大的QMR数据集,表明数据质量对单次学习结果有显著影响。
  • 结果证实,上下文层面的规律性和属性层面的共现模式均对单次学习有帮助,且两者的整合可获得最强性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。