Skip to main content
QUICK REVIEW

[论文解读] Sentence segmentation for classical Chinese based on LSTM with radical embedding

Xu Han, Hongsu Wang|arXiv (Cornell University)|Apr 30, 2019
Natural Language Processing Techniques参考文献 9被引用 5
一句话总结

本文提出了一种结合部首嵌入的新型LSTM-CRF模型,用于古汉语文本的句子切分。通过引入字符级别的部首特征,该模型在150部跨越三个朝代的先秦至近代中文典籍的多样化数据集上,显著提升了准确率,尤其在唐代墓志铭文本上表现更优,超越了先前的方法。

ABSTRACT

In this paper, we develop a low than character feature embedding called radical embedding, and apply it on LSTM model for sentence segmentation of pre modern Chinese texts. The datasets includes over 150 classical Chinese books from 3 different dynasties and contains different literary styles. LSTM CRF model is a state of art method for the sequence labeling problem. Our new model adds a component of radical embedding, which leads to improved performances. Experimental results based on the aforementioned Chinese books demonstrates a better accuracy than earlier methods on sentence segmentation, especial in Tang Epitaph texts.

研究动机与目标

  • 为解决不同文学风格的先秦至近代中文文本中句子切分的挑战。
  • 探究部首级别特征作为自然语言处理任务中低层级字符表示的有效性。
  • 通过将部首嵌入整合到序列标注框架中,提升切分准确率。
  • 在涵盖三个中国朝代的多样化大规模数据集上评估模型性能。

提出的方法

  • 提出一种新型的字符级别特征表示方法,称为部首嵌入,以捕捉汉字的形态结构。
  • 将部首嵌入作为输入特征整合到LSTM-CRF模型中,用于序列标注任务。
  • 使用来自唐代、宋代和元代的150余部古汉语典籍构成的数据集,涵盖多种文学风格。
  • 采用LSTM-CRF架构,这是序列标注任务的最先进方法,并通过引入部首特征进行增强。
  • 在句子切分任务上端到端训练模型,利用部首提供的上下文与结构信息。
  • 采用联合学习方法,其中CRF层用于建模词元之间的标签依赖关系。

实验结果

研究问题

  • RQ1与标准字符级嵌入相比,部首嵌入是否能提升古汉语文本中句子切分的性能?
  • RQ2所提出的模型在古汉语不同文学风格及朝代时期的表现如何?
  • RQ3部首级别特征的整合是否增强了模型对复杂案例(如唐代墓志铭)的切分能力?
  • RQ4在大规模、多样化的先秦至近代中文文本数据集上,该模型相较于现有方法的性能提升程度如何?

主要发现

  • 所提出的模型在古汉语文本的句子切分任务中,准确率高于以往方法。
  • 模型在唐代墓志铭文本上表现尤为突出,这类文本以句法复杂和书写规范多变著称。
  • 部首嵌入提供了有意义的语言学信息,增强了模型对句子边界识别的能力。
  • 将部首特征整合到LSTM-CRF框架中,使模型在全数据集上实现了可测量的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。