Skip to main content
QUICK REVIEW

[论文解读] Statistical Augmentation of a Chinese Machine-Readable Dictionary

Pascale Fung, Dekai Wu|ArXiv.org|Jan 1, 1994
Natural Language Processing Techniques被引用 3
一句话总结

本文提出一种统计方法,通过从大规模语料库中提取有效词形(如技术复合词、习语、姓名和地域术语)来扩充中文可机读词典。利用共现模式和频率分析,该方法提升了词典的覆盖范围,并增强了中文自动分词性能,评估结果显示在检测先前缺失的词汇项方面有显著提升。

ABSTRACT

We describe a method of using statistically-collected Chinese character groups from a corpus to augment a Chinese dictionary. The method is particularly useful for extracting domain-specific and regional words not readily available in machine-readable dictionaries. Output was evaluated both using human evaluators and against a previously available dictionary. We also evaluated performance improvement in automatic Chinese tokenization. Results show that our method outputs legitimate words, acronymic constructions, idioms, names and titles, as well as technical compounds, many of which were lacking from the original dictionary.

研究动机与目标

  • 解决现有中文可机读词典在专业术语和地域术语覆盖方面的局限性。
  • 开发一种可扩展的、数据驱动的方法,利用大规模语料库中的统计模式自动扩展词典条目。
  • 通过引入新发现的有效词形来丰富词库,从而提升自动中文分词的性能。

提出的方法

  • 该方法利用频率和共现分析,从大规模中文语料库中识别出具有统计显著性的字符组(n-gram)。
  • 采用统计阈值技术,将有意义的词类单位与随机字符序列区分开来。
  • 基于语言合理性对候选词形进行过滤,包括已知的词边界和形态约束。
  • 系统从语料库中提取并验证新的条目,如技术复合词、习语、缩略词、姓名和头衔。
  • 通过参考词典进行交叉验证,并由人工标注员评估词汇有效性。
  • 将扩充后的词典集成到分词处理流程中,以衡量性能提升。

实验结果

研究问题

  • RQ1能否通过语料库中统计推导出的字符组可靠地识别出原始词典中不存在的有效中文词汇项?
  • RQ2该统计扩充方法在多大程度上提升了中文词典对专业术语和地域词汇的覆盖度?
  • RQ3新发现的词汇项的引入如何影响自动中文分词的准确性?
  • RQ4哪些类型的词汇形式(如复合词、习语、姓名等)最有效地通过该方法被恢复?
  • RQ5人工评估者如何评价新提取词汇形式的质量与合法性?

主要发现

  • 该方法成功提取了大量合法的词汇项,包括技术复合词、习语、姓名、头衔和地域术语,这些在原始词典中均不存在。
  • 人工评估确认,大多数新提取的条目被母语者判定为有效且有意义。
  • 扩充后的词典显著提升了自动中文分词的性能,减少了在专业术语和罕见词汇上的分词错误。
  • 系统检测到大量此前未知的复合名词和缩略词结构,尤其在技术用语和地域语言使用中表现突出。
  • 统计阈值方法有效过滤了非词汇性字符序列,同时保留了高精度的词候选。
  • 该方法在多种文本领域(包括新闻、技术文档和非正式写作)中均表现出强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。