Skip to main content
QUICK REVIEW

[论文解读] A Rule-Based Approach To Prepositional Phrase Attachment Disambiguation

Eric Brill, Philip Resnik|ArXiv.org|Oct 25, 1994
Natural Language Processing Techniques被引用 16
一句话总结

本文提出了一种基于规则、基于转换的误差驱动学习方法,用于解决介词短语依附歧义问题,在华尔街日报语料库上实现了85.2%的准确率。该方法使用从大规模标注语料中提取的简单、人类可读的规则,优于以往基于语料库的方法(如词汇关联),并能高效整合词类信息,使规则数量减少一半,同时保持高性能。

ABSTRACT

In this paper, we describe a new corpus-based approach to prepositional phrase attachment disambiguation, and present results comparing performance of this algorithm with other corpus-based approaches to this problem.

研究动机与目标

  • 开发一种基于语料库的、基于规则的方法,以解决自然语言句子中介词短语依附歧义问题。
  • 通过生成更可解释、更紧凑的规则集(而非大型概率表),改进现有统计方法。
  • 探索将词类整合到规则学习过程中的方法,以提升性能,同时降低规则复杂度。
  • 证明简单的基于转换的学习算法可在极少参数调优的情况下实现具有竞争力的性能。
  • 实现将先验语言学知识整合到系统初始状态中,从而在标注数据上实现更明智的学习。

提出的方法

  • 该方法使用基于转换的误差驱动学习,迭代学习可纠正初始解析依附错误的规则。
  • 从已解析的语料中提取(动词,宾语名词,介词,支配名词)四元组,以获取依附决策的上下文线索。
  • 学习算法以贪心、有序的方式应用转换,在每一步选择最能提升与标准答案对齐效果的规则。
  • 系统从初始状态标注器(如随机或基于启发式的方法)开始,然后应用学习到的转换来优化依附关系。
  • 通过互信息聚类生成的词类被整合进来,以在词汇项之间实现泛化,从而在保持性能的同时减少规则数量。
  • 最终模型使用规则的排序列表,基于上下文线索决定依附位置——要么依附到动词,要么依附到宾语名词。

实验结果

研究问题

  • RQ1基于规则、基于转换的学习方法是否能在介词短语依附歧义消解中实现高于统计方法(如词汇关联)的准确率?
  • RQ2词类在多大程度上能提升性能,同时减少所需规则的数量?
  • RQ3该系统能否有效将先验语言学知识整合到初始状态中,从而提升学习效率和准确率?
  • RQ4该基于规则的方法在相同华尔街日报测试集上的性能与其它基于语料库的方法相比如何?
  • RQ5是否可能生成一个紧凑、可解释的规则集,使其比基于共现频率的大型概率表更有效地捕捉概念性泛化?

主要发现

  • 基于规则的方法在华尔街日报测试集上达到了85.2%的准确率,优于词汇关联基线方法。
  • 整合词类使转换规则总数减少了约一半,同时保持了高性能。
  • 该方法生成了一个紧凑、人类可读的规则集,比基于共现频率的统计模型更简洁地捕捉了概念性泛化。
  • 与其它基于语料库的方法相比,该方法表现出更优的性能,包括决策树模型(77.5%准确率)和基于类的概率模型(81.6%准确率)在相同测试集上的表现。
  • 系统可通过初始状态标注器轻松整合先验知识,且可通过添加新规则透明地处理异常情况。
  • 该系统的代码已公开,支持可复现性与进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。