Skip to main content
QUICK REVIEW

[论文解读] Modeling Semantic Plausibility by Injecting World Knowledge

Su Wang, Greg Durrett|arXiv (Cornell University)|Apr 2, 2018
Topic Modeling参考文献 12被引用 6
一句话总结

本文提出语义合理性(semantic plausibility)作为一项新的NLP任务,专注于识别在物理上合理但可能新颖的事件,例如一个人吞下一颗彩弹。该研究提出将人工获取的世界知识——尤其是关于物体属性(如尺寸、重量和物理限制)的知识——注入分布式模型中,实验表明,这种注入方法在一项新构建的、具有高一致性的3,062个s-v-o三元组数据集上显著提升了性能,使用黄金知识时模型F1值最高达到0.74,即使使用极少标注下传播得到的知识,模型也表现出强劲性能。

ABSTRACT

Distributional data tells us that a man can swallow candy, but not that a man can swallow a paintball, since this is never attested. However both are physically plausible events. This paper introduces the task of semantic plausibility: recognizing plausible but possibly novel events. We present a new crowdsourced dataset of semantic plausibility judgments of single events such as "man swallow paintball". Simple models based on distributional representations perform poorly on this task, despite doing well on selection preference, but injecting manually elicited knowledge about entity properties provides a substantial performance boost. Our error analysis shows that our new dataset is a great testbed for semantic plausibility models: more sophisticated knowledge representation and propagation could address many of the remaining errors.

研究动机与目标

  • 定义并形式化语义合理性任务,通过聚焦于新颖事件的物理合理性,将其与选择性偏好(selectional preference)区分开来。
  • 构建一个高质量、众包生成的3,062个s-v-o三元组数据集,实现强一致性标注(≥3/5票),并保持合理与不合理标签的平衡。
  • 探究将人工获取的世界知识——尤其是关于物体属性(如尺寸、重量和物理限制)——注入模型,是否能提升语义合理性预测性能。
  • 评估从少量黄金标注样本中传播知识的有效性,以降低标注成本,同时保持高性能。
  • 通过深入的错误分析识别建模语义合理性时的持续挑战,强调需要更丰富的知识表征。

提出的方法

  • 通过Amazon Mechanical Turk进行众包数据收集,标注者基于物理合理性生成并筛选s-v-o三元组,确保多样性与高一致性。
  • 采用Brysbaert等人(2014)提供的150个具体动词和450个具体名词的固定词汇表,并筛选出语义具体性≥4.95的词汇。
  • 在多数票(≥5名标注者中至少3人)筛选后构建3,062个三元组数据集,实现100%的≥3票一致性和95%的≥4票一致性。
  • 将世界知识特征(如尺寸、重量、可食性及物理属性)注入神经分类器,以提升合理性预测性能。
  • 应用信念传播(Ordinal-LR)方法,将少量黄金标注样本中的知识传播至整个数据集,实现低成本的知识注入。
  • 训练带有和不带注入世界知识的神经网络分类器(nn),通过10折交叉验证在完整数据集上评估性能。

实验结果

研究问题

  • RQ1仅靠分布式模型能否有效预测新颖事件的语义合理性?还是在物理上合理但罕见的事件上会失败?
  • RQ2在多大程度上,注入人工获取的世界知识——特别是关于物理物体属性的知识——能提升语义合理性预测性能?
  • RQ3从少量黄金标注样本中传播知识,在多大程度上能近似实现完整标注下的性能?
  • RQ4哪些类型的世界知识最有助于区分合理与不合理的事件?哪些仍难以建模?
  • RQ5当前模型的主要失败模式是什么?需要何种类型的知识表征才能克服这些缺陷?

主要发现

  • 未注入世界知识的神经模型(nn)在语义合理性任务上的F1得分为0.65,表明仅靠分布式数据不足以完成该任务。
  • 注入黄金标准世界知识特征(nn + wk-gold)后,性能提升至F1 0.74,证明显式物理知识能带来显著性能增益。
  • 从极小比例的黄金标注样本中传播知识(nn + wk-prop)也实现了强劲性能,F1达0.71,表明少量标注即可获得高质量结果。
  • 错误分析显示,基础模型失败但知识注入模型成功的情况中,60%是由于尺寸和重量限制所致,凸显此类特征的重要性。
  • 最持久的错误类型为数据稀疏性(32%)和高度特定的属性(68%),包括可食性(21%)、天然与人工属性(18%)、中空物体(15%)以及前足灵巧性(5%),表明当前知识表征仍存在明显缺口。
  • 研究表明,尽管分布式模型在语义合理性任务上表现不佳,但通过世界知识注入——尤其是结合知识传播——能以低标注成本有效应对核心挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。