Skip to main content
QUICK REVIEW

[论文解读] An Inventory of Preposition Relations

Vivek Srikumar, Dan Roth|arXiv (Cornell University)|May 24, 2013
Natural Language Processing Techniques参考文献 2被引用 10
一句话总结

本文提出了一种由预置项目(Preposition Project)的词义清单经语义相关义项合并而得的32种语义关系的统一分类体系。通过人工验证和标注者间一致性检验(kappa = 0.75),将介词义项映射到关系标签,该研究实现了介词在上下文中的语义标签一致性,支持下游自然语言处理任务,如介词义项消歧。

ABSTRACT

We describe an inventory of semantic relations that are expressed by prepositions. We define these relations by building on the word sense disambiguation task for prepositions and propose a mapping from preposition senses to the relation labels by collapsing semantically related senses across prepositions.

研究动机与目标

  • 定义跨多个介词的全面且语义一致的介词语义关系清单。
  • 通过整合不同介词间语义相关的义项,解决介词义项的歧义性。
  • 通过人工标注与验证,创建将介词语义映射到关系类型的标注数据集。
  • 通过提供标准化的语义分类体系,支持计算模型进行介词义项消歧。
  • 通过标注者间一致性检验与人工清理模糊或习语化义项,确保标签的一致性与可靠性。

提出的方法

  • 通过识别不同介词间语义等价的义项,将预置项目词典中的介词语义映射到关系标签。
  • 利用义项定义及关联介词,将语义相似的义项聚类为32种类别关系。
  • 通过人工清理阶段处理模糊或习语化义项,使用20个SemEval 2007训练样例的多数标注结果作为依据。
  • 通过两名母语英语者仅依据关系定义作为指导原则,对200个句子进行标注,以验证映射结果。
  • 使用Cohen’s kappa(0.75)度量标注者间一致性,并与原始语料库标签进行比较(kappa = 0.74–0.76)。
  • 利用所提出的映射方法,将SemEval 2007介词语义数据集转换为关系标注的示例。

实验结果

研究问题

  • RQ1不同词汇项中,介词是否一致表达特定的语义关系?
  • RQ2如何系统性地将语义相关的介词语义合并为一致的关系类别?
  • RQ3人类专家在多大程度上能可靠地标注统一的介词语义关系分类体系?
  • RQ4与现有介词语义词典相比,所提出的语义关系映射在覆盖范围与语义一致性方面表现如何?
  • RQ5在标准基准数据集中,各类介词语义关系的样本分布情况如何?

主要发现

  • 该分类体系定义了32种由34个介词表达的独立语义关系,涵盖空间、时间、因果及抽象关系。
  • ‘ObjectOfVerb’关系拥有最多的训练样本(1,801个)和测试样本(882个),表明其在语言数据中的普遍性。
  • “Location”关系以3,096个训练样本和1,531个测试样本位居第二,反映出其在自然语言中的高频使用。
  • “Other”关系虽关联的义项最多(72个),但样本最少(测试集仅42个),表明其捕捉的是罕见或非一致的介词用法。
  • “Destination”和“Direction”关系分别拥有1,054个和909个训练样本,显示其在方向性与运动相关结构中的显著地位。
  • 标注者间一致性达到中等水平(kappa = 0.75),证实了关系定义在标注过程中的可靠性和清晰度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。