Skip to main content
QUICK REVIEW

[论文解读] Extracting Noun Phrases from Large-Scale Texts: A Hybrid Approach and Its Automatic Evaluation

Kuang‐Hua Chen, Hsin‐Hsi Chen|ArXiv.org|Jun 1, 1994
Natural Language Processing Techniques参考文献 7被引用 11
一句话总结

本文提出了一种混合方法,通过结合概率性切块器以识别句法成分的边界,以及基于语言学规则的有限状态机制以提取名词短语,从而从大规模文本中提取名词短语。在SUSANNE语料库上的评估显示,该方法取得了令人满意的结果,证明了在全自动评估框架中整合统计方法与基于规则的方法在名词短语提取中的有效性。

ABSTRACT

To acquire noun phrases from running texts is useful for many applications, such as word grouping,terminology indexing, etc. The reported literatures adopt pure probabilistic approach, or pure rule-based noun phrases grammar to tackle this problem. In this paper, we apply a probabilistic chunker to deciding the implicit boundaries of constituents and utilize the linguistic knowledge to extract the noun phrases by a finite state mechanism. The test texts are SUSANNE Corpus and the results are evaluated by comparing the parse field of SUSANNE Corpus automatically. The results of this preliminary experiment are encouraging.

研究动机与目标

  • 开发一种从大规模连续文本中有效提取名词短语的方法。
  • 通过结合两者的优点,解决纯概率性或纯基于规则方法的局限性。
  • 设计一种系统,利用语言学知识与统计边界检测以提高准确性。
  • 使用SUSANNE语料库的解析字段作为黄金标准,对方法进行全自动评估。
  • 证明混合架构在名词短语提取中的可行性和有效性。

提出的方法

  • 使用概率性切块器确定连续文本中句法成分的隐式边界。
  • 将语言学规则编码到有限状态机制中,以从切块输出中识别并提取名词短语。
  • 系统整合了统计边界检测与基于规则的短语识别,以提高精确度。
  • 该方法应用于SUSANNE语料库,这是一个大规模、人工标注的文本集合。
  • 通过将系统输出与SUSANNE语料库的解析字段直接比较来执行评估。
  • 该方法实现了无需对结果进行人工标注的全自动评估。

实验结果

研究问题

  • RQ1结合概率性切块与基于规则解析的混合方法是否能提高名词短语提取的准确性?
  • RQ2将语言学知识与统计边界检测相结合,对提取性能有何影响?
  • RQ3在SUSANNE语料库的解析字段基础上进行自动评估,能在多大程度上验证系统输出?
  • RQ4所提出的方法在名词短语提取中是否优于纯概率性或纯基于规则的方法?
  • RQ5当应用于大规模文本语料库时,该混合系统是否具有鲁棒性与有效性?

主要发现

  • 该混合方法成功结合了概率性切块与基于规则解析在名词短语提取中的优势。
  • 系统在SUSANNE语料库的初步评估中取得了令人鼓舞的结果。
  • 使用SUSANNE语料库解析字段进行的自动评估,为性能评估提供了可靠的基准。
  • 语言学知识的整合使名词短语提取的精确度超越了仅依靠概率模型所能达到的水平。
  • 结果表明,混合系统是单一概率性或基于规则方法的可行且有效的替代方案。
  • 该方法在极少人工干预的情况下,展示了大规模名词短语提取的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。