Skip to main content
QUICK REVIEW

[论文解读] Automatic Extraction of Subcategorization from Corpora

Ted Briscoe, John M. Carroll|arXiv (Cornell University)|Feb 4, 1997
Natural Language Processing Techniques参考文献 20被引用 14
一句话总结

本文提出了一套新颖的系统,通过使用稳健的概率解析器和统计分类方法,从原始语料库中自动提取全面的子类格框架——共160种不同类别。该方法在准确率上与先前系统相当,同时捕捉了子类格模式的相对频率,在集成到概率语法时显著提升了解析器性能。

ABSTRACT

We describe a novel technique and implemented system for constructing a subcategorization dictionary from textual corpora. Each dictionary entry encodes the relative frequency of occurrence of a comprehensive set of subcategorization classes for English. An initial experiment, on a sample of 14 verbs which exhibit multiple complementation patterns, demonstrates that the technique achieves accuracy comparable to previous approaches, which are all limited to a highly restricted set of subcategorization classes. We also demonstrate that a subcategorization dictionary built with the system improves the accuracy of a parser by an appreciable amount.

研究动机与目标

  • 开发一种自动化方法,从原始语料库中构建全面且具有频率敏感性的子类格词典。
  • 克服人工词典构建的局限性,后者易出错、耗时费力,且无法捕捉子类格频率或领域差异。
  • 实现对动词的准确、可扩展的子类格信息获取,包括控制、交替现象及语义偏好。
  • 评估在概率解析框架中引入子类格频率数据是否能显著提升解析准确率。

提出的方法

  • 系统使用一阶隐马尔可夫模型(HMM)词性标注器,为句子中的词语分配并排序词性标签。
  • 词形还原器利用增强的GATE词干提取器,将词-词性对替换为词形-词性对,以标准化词形。
  • 基于语料库训练的概率LR解析器,对标注输入的句子网格生成带排序的浅层句法分析。
  • 模式集提取器从以目标谓词为中心的子分析中,识别句法成分及其句法类别和核心词形。
  • 模式分类器基于特征值和先验概率估计,将提取的模式分配到160种预定义的子类格类别之一。
  • 系统应用统计过滤机制,剔除低置信度或模糊的模式,以提高分类的可靠性。

实验结果

研究问题

  • RQ1一个完全自动化的系统能否从原始语料库中以与现有系统相当的准确率,提取出多达160种子类格类别的完整集合?
  • RQ2该系统能否可靠地估计单个动词的不同子类格模式的相对频率?
  • RQ3在概率解析器中整合子类格频率信息是否能显著提升解析准确率?
  • RQ4该系统如何处理子类格模式中的复杂现象,如控制、移位和副词移动?

主要发现

  • 该系统在14个动词的子类格模式分类中平均达到81.4%的准确率,尽管类别数量高达160种,仍与先前系统相当。
  • 该系统成功捕捉了单个动词的子类格类别的相对频率,使其可应用于概率解析。
  • 一项小规模实验表明,将子类格频率数据整合到概率语法中可显著提升解析准确率。
  • 系统的统计过滤机制被识别为最薄弱的环节,表明需进一步优化以减少误报并提高精确度。
  • 该方法可扩展至名词性及形容词性谓词,因为其底层语法已能区分论元类型与状语。
  • 该系统可适配其他语言,前提是具备类似的自然语言处理工具;若缺乏现有词典,则需预先估算词汇统计信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。