Skip to main content
QUICK REVIEW

[论文解读] Adaptive Sentence Boundary Disambiguation

David D. Palmer, Marti A. Hearst|ArXiv.org|Nov 16, 1994
Natural Language Processing Techniques参考文献 7被引用 18
一句话总结

本文提出一种可训练的前馈神经网络方法,用于自适应的句子边界消歧,该方法使用词性概率作为上下文特征,而非原始词汇或固定规则。在27,000个标记的语料上训练时间不足一分钟,该方法准确率超过98.5%,且在单大小写文本上泛化能力良好,相较于基于规则的系统在适应性和效率方面表现更优,同时所需人工干预极少。

ABSTRACT

Labeling of sentence boundaries is a necessary prerequisite for many natural language processing tasks, including part-of-speech tagging and sentence alignment. End-of-sentence punctuation marks are ambiguous; to disambiguate them most systems use brittle, special-purpose regular expression grammars and exception rules. As an alternative, we have developed an efficient, trainable algorithm that uses a lexicon with part-of-speech probabilities and a feed-forward neural network. After training for less than one minute, the method correctly labels over 98.5\% of sentence boundaries in a corpus of over 27,000 sentence-boundary marks. We show the method to be efficient and easily adaptable to different text genres, including single-case texts.

研究动机与目标

  • 开发一种稳健、可训练的句子边界消歧系统,避免依赖大写或间距的脆弱手工规则。
  • 通过使用词性概率特征作为上下文,减少对领域特定启发式方法的依赖,以实现标点符号的消歧。
  • 创建一种训练速度快、存储需求低、可轻松适配新文本类型和语言的系统。
  • 实现在低大小写或单大小写文本中的准确消歧,此类文本因缺乏大写提示而使传统方法失效。
  • 提供一种灵活、可扩展的替代方案,以替代需要大量人工调优和庞大规则集的基于规则的系统。

提出的方法

  • 该方法使用基于词典生成的词性概率作为输入,而非原始词符或固定词性标签,训练一个前馈神经网络。
  • 通过六个上下文标记(标记前三个、后三个)建模上下文,使用其词性概率的先验概率表示。
  • 利用小规模标注的句子边界标记训练集,通过反向传播算法进行训练,并使用交叉验证调整超参数。
  • 系统基于网络激活输出二元决策(是否为句末),并可通过可配置阈值实现对模糊情况的“无意见”处理。
  • 该方法设计为输入格式与语言无关,仅依赖于词性概率描述数组和一个词典。
  • 通过交叉验证调整隐藏层大小和上下文窗口等超参数,以优化假阳性和假阴性率。

实验结果

研究问题

  • RQ1词性概率分布能否作为句子边界消歧的有效且高效的上下文特征?
  • RQ2在准确率和适应性方面,基于词性概率特征训练的神经网络与基于规则的系统相比表现如何?
  • RQ3该系统在缺乏大写提示的低大小写或单大小写文本中,其泛化能力达到何种程度?
  • RQ4为最小化边界消歧中的错误率,最优的上下文窗口和网络架构是什么?
  • RQ5该方法是否可在无需重编程的情况下轻松适配新文本类型和语言?

主要发现

  • 系统在27,000个标点符号的语料上训练不足一分钟,句子边界标注准确率超过98.5%。
  • 具有两个隐藏单元和六标记上下文窗口的网络在假阳性与假阴性之间达到最佳平衡,整体错误率最低。
  • 在仅小写字母的测试集中,该方法正确消歧了96.2%的边界;在仅大写字母的测试集中,正确率高达97.4%,表明其在单大小写文本中表现优异。
  • 该方法优于以往的神经网络方法(例如Humphrey和Zhou的93%准确率),且在准确率上与基于规则的系统相当或更优,但所需人工工作量少得多。
  • 该系统表现出高度适应性:无需修改代码即可支持新语言,仅需获取词性频率词典和缩写词列表。
  • 交叉验证显示,增加隐藏单元数可将假阴性降至零,但会增加假阳性,表明存在可由阈值设置调节的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。