Skip to main content
QUICK REVIEW

[论文解读] The Preposition Project

Kenneth C. Litkowski, Orin Hargraves|arXiv (Cornell University)|Apr 18, 2021
Natural Language Processing Techniques参考文献 6被引用 6
一句话总结

Preposition Project 引入了一个全面的、人工整理的介词语义数据库,该数据库源自 FrameNet 语料库,采用词典引导的语义义项目录和语义角色分析。通过系统性地消歧介词并建模其句法与语义行为,该项目生成了一个用于自然语言处理的金标准语料库,公开提供的数据集可提升计算语言学中语义角色标注和介词分析的性能。

ABSTRACT

Prepositions are an important vehicle for indicating semantic roles. Their meanings are difficult to analyze and they are often discarded in processing text. The Preposition Project is designed to provide a comprehensive database of preposition senses suitable for use in natural language processing applications. In the project, prepositions in the FrameNet corpus are disambiguated using a sense inventory from a current dictionary, guided by a comprehensive treatment of preposition meaning. The methodology provides a framework for identifying and characterizing semantic roles, a gold standard corpus of instances for further analysis, and an account of semantic role alternation patterns. By adhering to this methodology, it is hoped that a comprehensive and improved characterization of preposition behavior (semantic role identification, and syntactic and semantic properties of the preposition complement and attachment point) will be developed. The databases generated in the project are publicly available for further use by researchers and application developers.

研究动机与目标

  • 创建一个全面的、经人工标注的介词语义数据库,适用于自然语言处理应用。
  • 开发一种系统化的方法,利用当前词典的义项目录和语义角色理论对介词进行消歧。
  • 生成一个包含准确语义角色标注的介词实例金标准语料库,以支持进一步的语言学与计算分析。
  • 建模介词补语和依附点的语义角色交替模式及句法属性。
  • 提供公开可访问的数据集,以支持计算语言学和语义解析领域的研究与开发。

提出的方法

  • 使用源自当前单语词典的义项目录,对 FrameNet 语料库中的介词进行人工消歧。
  • 通过全面的介词语义处理指导语义角色和义项差异的分配。
  • 该方法强调对语义角色、句法依附点和补语属性的一致识别。
  • 该流程生成了一个带有详细语义角色和句法信息的标注介词实例金标准语料库。
  • 生成的数据库结构化设计,可用于自然语言处理系统,包括语义角色标注和介词分析工具。
  • 该框架支持对不同介词语义下语义角色交替模式的系统性分析。

实验结果

研究问题

  • RQ1如何利用基于词典的义项目录和语义角色理论,系统性地对介词进行消歧?
  • RQ2介词补语和依附点的句法与语义属性是否具有一致性?
  • RQ3在真实文本语料库中,不同介词语义下的语义角色如何变化?
  • RQ4自然语言中介词使用如何呈现出语义角色交替的模式?
  • RQ5如何通过人工整理的、金标准的介词语料库支持自然语言处理应用?

主要发现

  • 该项目成功从 FrameNet 语料库中生成了一个全面的、经人工标注的介词语义数据库,语义角色标注具有一致性。
  • 已建立一种基于词典义项和语义角色理论的系统化介词消歧方法,确保可重复性和一致性。
  • 标注语料库准确捕捉了介词补语和依附点的句法与语义属性,支持对介词行为的深入分析。
  • 该项目识别并描述了与不同介词语义相关的语义角色交替的重复性模式。
  • 生成的数据集公开可获取,并专为直接用于自然语言处理应用(包括语义角色标注和介词分析)而设计。
  • 该框架为提升下游自然语言处理任务中对介词的理解提供了可靠基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。