Skip to main content
QUICK REVIEW

[论文解读] Robust Chinese Word Segmentation with Contextualized Word Representations

Yung-Sung Chuang|arXiv (Cornell University)|Jan 17, 2019
Topic Modeling参考文献 19被引用 4
一句话总结

本文提出一种基于双向LSTM与ELMo生成的上下文表征的鲁棒中文分词模型,显著降低了未登录词(OOV)错误率。通过利用上下文相关的嵌入表示,该模型在多个数据集上实现了最先进性能,尤其在OOV词上相比基线模型准确率提升高达5%。

ABSTRACT

In recent years, after the neural-network-based method was proposed, the accuracy of the Chinese word segmentation task has made great progress. However, when dealing with out-of-vocabulary words, there is still a large error rate. We used a simple bidirectional LSTM architecture and a large-scale pretrained language model to generate high-quality contextualize character representations, which successfully reduced the weakness of the ambiguous meanings of each Chinese character that widely appears in Chinese characters, and hence effectively reduced OOV error rate. State-of-the-art performance is achieved on many datasets.

研究动机与目标

  • 为解决中文分词中未登录词(OOV)这一长期存在的挑战,该挑战在实际应用中严重限制模型泛化能力。
  • 通过将上下文无关的字符表征替换为捕捉周围字符语义依赖关系的上下文嵌入,提升模型鲁棒性。
  • 评估ELMo生成的上下文表征是否能显著降低相比传统神经网络模型在OOV词上的错误率。
  • 证明仅使用非堆叠的双向LSTM架构结合ELMo嵌入,即可在标准中文分词基准上实现最先进性能。

提出的方法

  • 模型使用三层双向LSTM处理源自ELMo嵌入的字符级输入,这些嵌入具有上下文敏感性,并随句子动态调整。
  • 输入表征通过字符级CNN生成,随后在ELMo框架中经过两层双向LSTM,为每个字符生成上下文表征。
  • 输出层应用双向Softmax,以预测在每个字符位置是继续(追加到当前词)还是分隔(结束当前词并开始新词)。
  • ELMo嵌入在字符分词句子上进行微调,以保持训练与推理期间的一致性,提升字符表征质量。
  • 模型使用Adam优化器和交叉熵损失进行训练,微调过程中调整ELMo的标量缩放和Softmax归一化权重,以适应下游任务。
  • 通过与使用skip-gram Word2Vec嵌入的基线模型对比,评估上下文化表征对OOV性能的影响。

实验结果

研究问题

  • RQ1ELMo生成的上下文表征能否显著降低中文分词中的未登录词(OOV)错误率?
  • RQ2在分词准确率与OOV鲁棒性方面,使用ELMo嵌入的简单非堆叠双向LSTM架构与更复杂的堆叠LSTM模型相比如何?
  • RQ3相比上下文无关嵌入,上下文表征在未见OOV词上的泛化能力提升程度如何?
  • RQ4为何该模型在MSR数据集上改进有限,尽管在其他数据集上OOV性能表现优异?

主要发现

  • 所提模型在所有评估的中文分词数据集上均达到最先进性能,优于先前的SOTA模型。
  • 在OOV词上,模型准确率约为96%,相比使用skip-gram嵌入的基线模型提升约5%。
  • 模型在OOV词上表现出显著更强的鲁棒性,尤其在OOV率较高的数据集中,基线模型的OOV准确率下降至约91%。
  • MSR数据集的改进微乎其微,原因在于其OOV率较低(2.6%),且含有大量含数字或命名实体的OOV词(如“15類”、“中共湖北省委”),这些词常被基于规则的方法一致分词。
  • 统计分析表明,MSR数据集中36%的OOV词长度超过5个字符,而其他数据集不足10%,表明长命名实体OOV词限制了模型优势。
  • 模型在歧义分词如“老歌”(老歌)或“抗癌”(抗癌)上表现不佳,因人工标注分词可能与语义分词不一致,影响评估指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。