Skip to main content
QUICK REVIEW

[论文解读] A Chinese Dataset with Negative Full Forms for General Abbreviation Prediction

Yi Zhang, Xu Sun|arXiv (Cornell University)|Dec 18, 2017
Natural Language Processing Techniques参考文献 19被引用 4
一句话总结

本文提出了一种用于通用缩写预测的新型中文数据集,包含无有效缩写的负全形词(NFFs),填补了现有语料库中的关键空白。该数据集基于可靠的NLP资源构建,并经过分词与词性标注预处理,可用于训练和评估CRF、MEMM、感知机及双向LSTM等模型,其中双向LSTM在准确率和NFF区分任务中表现最佳。

ABSTRACT

Abbreviation is a common phenomenon across languages, especially in Chinese. In most cases, if an expression can be abbreviated, its abbreviation is used more often than its fully expanded forms, since people tend to convey information in a most concise way. For various language processing tasks, abbreviation is an obstacle to improving the performance, as the textual form of an abbreviation does not express useful information, unless it's expanded to the full form. Abbreviation prediction means associating the fully expanded forms with their abbreviations. However, due to the deficiency in the abbreviation corpora, such a task is limited in current studies, especially considering general abbreviation prediction should also include those full form expressions that do not have valid abbreviations, namely the negative full forms (NFFs). Corpora incorporating negative full forms for general abbreviation prediction are few in number. In order to promote the research in this area, we build a dataset for general Chinese abbreviation prediction, which needs a few preprocessing steps, and evaluate several different models on the built dataset. The dataset is available at https://github.com/lancopku/Chinese-abbreviation-dataset

研究动机与目标

  • 为解决现有语料库中缺乏包含负全形词(NFFs)的中文缩写预测数据集的问题,这些词在真实文本中常见但未被充分代表。
  • 构建一个全面且可靠的中文全形词数据集——包含具有有效缩写的词和无有效缩写的词——以支持通用缩写预测研究。
  • 在该新数据集上评估多种机器学习模型,包括CRF、MEMM、平均感知机和双向LSTM,以评估其在正全形词与负全形词预测中的表现。
  • 证明神经网络,特别是双向LSTM,在处理通用缩写预测的复杂性方面优于传统模型,尤其在区分NFFs方面表现更优。

提出的方法

  • 该数据集从公认的中文NLP语料库(如《人民日报》)中构建,包含正全形词(具有有效缩写)和负全形词(无有效缩写)。
  • 预处理步骤包括分词和词性(POS)标注,以提供模型输入的语义特征。
  • 全形词中的每个字符均被赋予分词标签和词性标签,这些标签被嵌入为20维向量,并与50维字符嵌入向量拼接,形成序列模型的输入。
  • 采用双向LSTM(BLSTM)以捕捉过去与未来上下文信息,隐藏层大小为200(前向100,后向100),并通过条件标签机制预测缩写字符。
  • CRF模型用作序列标注基线,利用全局特征依赖关系;MEMM与平均感知机则作为传统判别模型用于对比。
  • 模型评估采用两项指标:全匹配准确率(将完整预测缩写与标准答案比较)和字符准确率(逐字符预测准确率)。

实验结果

研究问题

  • RQ1是否可通过大规模包含负全形词(NFFs)的中文数据集提升通用缩写预测模型的性能?
  • RQ2传统序列模型(CRF、MEMM、平均感知机)与深度学习模型(BLSTM)在缩写预测中的表现如何比较,尤其是在区分NFFs方面?
  • RQ3引入词性与分词信息在多大程度上能提升缩写预测性能?
  • RQ4双向LSTM是否在捕捉缩写生成的上下文依赖关系方面优于其他模型,特别是在处理中文中不规则缩写模式方面?

主要发现

  • 双向LSTM模型在整体性能上表现最佳,在全匹配准确率与字符级准确率上均优于CRF、MEMM与平均感知机。
  • CRF模型表现强劲,尤其在字符级准确率方面,表明其在建模缩写预测的序列依赖关系方面具有优势。
  • 简单的启发式基线方法(即取每个词的首字母)表现较差,凸显了处理中文不规则缩写模式需要更复杂的模型。
  • 引入负全形词(NFFs)显著增加了任务难度,所有模型的性能均下降,尤其在区分NFFs与正全形词方面表现更差。
  • 该数据集可在 https://github.com/lancopku/Chinese-abbreviation-dataset 获取,为未来包含NFFs的中文缩写预测研究提供了宝贵基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。