Skip to main content
QUICK REVIEW

[论文解读] Is Word Segmentation Necessary for Deep Learning of Chinese Representations?

Xiaoya Li, Yuxian Meng|arXiv (Cornell University)|May 14, 2019
Natural Language Processing Techniques参考文献 51被引用 20
一句话总结

本文通过在四个任务中对比基于词的模型与基于字的模型,研究了深度学习中的中文分词(CWS)是否真正必要。研究发现,基于字的模型由于减少了数据稀疏性、OOV词数量更少以及过拟合程度更低,始终优于基于词的模型,表明在现代深度学习设置中,CWS可能并非必需。

ABSTRACT

Segmenting a chunk of text into words is usually the first step of processing Chinese text, but its necessity has rarely been explored. In this paper, we ask the fundamental question of whether Chinese word segmentation (CWS) is necessary for deep learning-based Chinese Natural Language Processing. We benchmark neural word-based models which rely on word segmentation against neural char-based models which do not involve word segmentation in four end-to-end NLP benchmark tasks: language modeling, machine translation, sentence matching/paraphrase and text classification. Through direct comparisons between these two types of models, we find that char-based models consistently outperform word-based models. Based on these observations, we conduct comprehensive experiments to study why word-based models underperform char-based models in these deep learning-based NLP tasks. We show that it is because word-based models are more vulnerable to data sparsity and the presence of out-of-vocabulary (OOV) words, and thus more prone to overfitting. We hope this paper could encourage researchers in the community to rethink the necessity of word segmentation in deep learning-based Chinese Natural Language Processing. \footnote{Yuxian Meng and Xiaoya Li contributed equally to this paper.}

研究动机与目标

  • 检验中文分词(CWS)在基于深度学习的中文自然语言处理中是否真正必要。
  • 在端到端的自然语言处理任务中,对比依赖CWS的基于词的模型与无需CWS的基于字的模型的性能。
  • 探究基于词的模型表现不佳的根本原因,包括数据稀疏性、OOV词以及过拟合问题。
  • 挑战长期以来认为CWS能提升深度学习中中文表征学习的假设。

提出的方法

  • 在四个端到端的自然语言处理任务(语言建模、机器翻译、句子匹配和文本分类)中,对基于词和基于字的神经网络模型进行基准测试。
  • 使用频率阈值控制词表大小和OOV率,以实现模型间的可控比较。
  • 应用Dropout正则化并分析其影响,以评估过拟合倾向。
  • 在语义匹配任务中可视化注意力机制,比较语义相似句子中词语与字符之间的对齐情况。
  • 通过在不同频率阈值下移除包含OOV词的句子,隔离OOV词对模型性能的影响。
  • 分析词和字符的频率分布,量化数据稀疏性及其对模型学习的影响。

实验结果

研究问题

  • RQ1在基于深度学习的中文自然语言处理任务中,分词是否能持续提供性能优势?
  • RQ2与基于字的模型相比,基于词的模型表现不佳的主要原因是什么?
  • RQ3未登录词(OOV)和数据稀疏性在多大程度上影响模型的泛化能力和过拟合?
  • RQ4通过减少OOV词,能否缩小基于词与基于字模型之间的性能差距?
  • RQ5标注的CWS数据集是否真正有益于下游自然语言处理任务,还是在深度学习设置中已冗余?

主要发现

  • 在所有四个基准任务(语言建模、机器翻译、句子匹配和文本分类)中,基于字的模型始终优于基于词的模型。
  • 在BQ语义匹配任务中,表现最佳的基于字的模型达到80.82的准确率,优于表现最佳的基于词的模型(80.65),即使在最优Dropout率(0.5对比0.3)下依然如此。
  • 基于词的模型存在严重的过拟合问题,需要比基于字的模型更高的Dropout率(0.5对比0.3),表明其对数据稀疏性更敏感。
  • 随着训练数据中OOV词被逐步移除,基于词与基于字模型之间的性能差距缩小,但基于字的模型仍保持优势,尤其在较高频率阈值下更为明显。
  • 基于词的模型表现出严重的数据稀疏性:48.7%的唯一词仅出现一次,仅占语料的4.0%,导致参数学习效果差且易过拟合。
  • 可视化结果显示,基于字的模型能更好地对齐语义相似句子中的字符(如“利息”),而基于词的模型由于严格的词边界限制,无法将子词如“利息”正确映射到其组成部分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。