Skip to main content
QUICK REVIEW

[论文解读] State-of-the-art Chinese Word Segmentation with Bi-LSTMs

Ji Ma, Kuzman Ganchev|arXiv (Cornell University)|Aug 20, 2018
Topic Modeling参考文献 17被引用 6
一句话总结

该论文表明,通过结合预训练词嵌入、Dropout 和严格的超参数调优,仅使用字符和二元语法嵌入的简单双向LSTM,在多个中文分词基准测试中实现了最先进(SOTA)的性能,超越了更复杂的模型架构。关键洞见在于,模型架构的复杂性带来的收益递减,未来性能提升更多依赖于外部资源而非模型设计的创新。

ABSTRACT

A wide variety of neural-network architectures have been proposed for the task of Chinese word segmentation. Surprisingly, we find that a bidirectional LSTM model, when combined with standard deep learning techniques and best practices, can achieve better accuracy on many of the popular datasets as compared to models based on more complex neural-network architectures. Furthermore, our error analysis shows that out-of-vocabulary words remain challenging for neural-network models, and many of the remaining errors are unlikely to be fixed through architecture changes. Instead, more effort should be made on exploring resources for further improvement.

研究动机与目标

  • 评估在应用最佳实践的前提下,更简单的神经网络架构是否能在中文分词任务中超越更复杂的架构。
  • 识别分词错误的主要来源,并评估是否可通过模型架构改进来解决。
  • 探究数据质量,特别是标注不一致性,在限制模型性能方面的作用。
  • 判断未登录词(OOV)和语义歧义是否是监督学习模型的根本性限制。
  • 通过展示外部资源和更优的数据整理比架构迭代更具前景,为未来研究提供指导。

提出的方法

  • 使用两层、每层256个隐藏单元的堆叠双向LSTM,对每个词元位置的字符和字符二元语法嵌入进行处理。
  • 输入特征在送入双向LSTM前进行嵌入并拼接,LSTM预测BIES(开始/内部/结束/单独)分词标签。
  • 根据Gal和Ghahramani(2016)的方法,在LSTM隐藏状态上应用循环Dropout,以提升泛化能力。
  • 通过基于动量的平均SGD并结合梯度范数裁剪,对学习率、学习率调度策略和Dropout率等超参数进行人工网格搜索调优。
  • 通过wang2vec学习预训练的字符和二元语法嵌入,并通过消融实验比较固定嵌入与微调嵌入的效果。
  • 通过人工检查104个测试错误样本,并利用基于词共现模式的自动化脚本检测标注不一致性,开展错误分析。

实验结果

研究问题

  • RQ1当采用最佳实践训练时,简单的双向LSTM模型是否能在中文分词任务中实现最先进性能?
  • RQ2未登录词(OOV)和语义歧义在多大程度上导致了分词错误?
  • RQ3训练语料中存在标注不一致性如何影响模型性能和泛化能力?
  • RQ4架构创新是否足以解决剩余错误,还是需要引入外部知识?
  • RQ5使用预训练嵌入是否显著提升了OOV词的召回率和分词准确率?

主要发现

  • 在所有主要基准测试中,该简单双向LSTM模型均实现了最先进性能,即使在超参数调优后,仍优于更复杂的架构。
  • 在MSR数据集上,该模型达到97.8%的F1值,超过先前工作(如Zhou等,2017年为97.8%,Liu等,2016年为97.3%)。
  • 约34%的错误源于标注不一致性,仅靠模型架构无法解决。
  • 在43个过度分词错误中,约37个涉及由常见子词构成的OOV(如“抽象概念”被分词为“抽象”+“概念”),表明仅依赖训练数据的监督学习存在根本性局限。
  • 预训练嵌入使OOV召回率提升约10%,但无法完全解决语义歧义或高频子词构成的OOV问题。
  • 标注不一致性更高的语料(如AS的不一致性为1.31%)即使训练集更大,模型性能也更低,表明数据质量是关键瓶颈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。