Skip to main content
QUICK REVIEW

[论文解读] BERT Meets Chinese Word Segmentation

Haiqin Yang|arXiv (Cornell University)|Sep 20, 2019
Topic Modeling参考文献 20被引用 12
一句话总结

本文研究了 BERT 在中文分词(CWS)中的应用,表明与基线模型相比,BERT 在 MSR 数据集上将 F1 分数提升了 +0.3,在 PKU 数据集上提升了 +0.4。结果表明,BERT 的上下文特征即使在标注不一致的情况下也具有鲁棒性,且更简单的分类器(如 Softmax)在计算成本显著更低的情况下,性能与 CRF 相当。

ABSTRACT

Chinese word segmentation (CWS) is a fundamental task for Chinese language understanding. Recently, neural network-based models have attained superior performance in solving the in-domain CWS task. Last year, Bidirectional Encoder Representation from Transformers (BERT), a new language representation model, has been proposed as a backbone model for many natural language tasks and redefined the corresponding performance. The excellent performance of BERT motivates us to apply it to solve the CWS task. By conducting intensive experiments in the benchmark datasets from the second International Chinese Word Segmentation Bake-off, we obtain several keen observations. BERT can slightly improve the performance even when the datasets contain the issue of labeling inconsistency. When applying sufficiently learned features, Softmax, a simpler classifier, can attain the same performance as that of a more complicated classifier, e.g., Conditional Random Field (CRF). The performance of BERT usually increases as the model size increases. The features extracted by BERT can be also applied as good candidates for other neural network models.

研究动机与目标

  • 评估 BERT 是否能够提升中文分词(CWS)这一基础自然语言处理任务的性能。
  • 研究在使用 BERT 特征时,字符级表示与不同分类器(如 Softmax 与 CRF)之间的权衡。
  • 分析 BERT 模型大小对 CWS 性能的影响。
  • 评估 BERT 提取的特征是否可作为其他神经网络 CWS 模型的有效、类似 ELMo 的表示。
  • 识别并分析基准数据集中标注不一致的问题,方法是利用 BERT 对习语表达的预测结果进行分析。

提出的方法

  • 在领域内 CWS 数据集(MSR 和 PKU)上微调 BERT,以提取上下文化的标记表示。
  • 将 BERT 的最终隐藏状态作为下游 CWS 分类器的输入特征,替代传统的字符嵌入。
  • 比较在 BERT 嵌入特征上使用 Softmax 和条件随机场(CRF)的分类器性能。
  • 训练并评估不同尺寸的 BERT 模型(base 和 large),以评估模型容量对 CWS 准确率的影响。
  • 将 BERT 特征作为预训练的上下文表示应用于其他神经网络 CWS 架构中,测试其可迁移性。
  • 通过分析习语表达上的预测错误,检测训练集和测试集标注中的不一致性。

实验结果

研究问题

  • RQ1即使在训练数据中标注不一致的情况下,BERT 是否仍能提升中文分词任务的性能?
  • RQ2当与 BERT 特征结合时,使用 Softmax 和 CRF 作为分类器之间存在怎样的权衡?
  • RQ3BERT 模型的大小如何影响其在 CWS 基准测试上的分词性能?
  • RQ4BERT 特征是否可以作为上下文表示被有效复用于其他神经网络 CWS 模型中,类似于 ELMo?
  • RQ5BERT 的预测在多大程度上揭示了基准数据集标注中的不一致,特别是对于习语短语?

主要发现

  • 当使用 Softmax 作为分类器时,BERT 在 MSR 数据集上将 CWS 性能提升了 +0.3 F1 分数,在 PKU 数据集上提升了 +0.4 F1 分数。
  • 当与充分学习的 BERT 特征结合时,Softmax 达到了与 CRF 相当的性能,但推理时间显著更低。
  • 更大的 BERT 模型始终能带来更好的 CWS 性能,表明模型大小与分词准确率之间存在正相关关系。
  • BERT 提取的特征可作为有效的上下文表示,并能成功复用于其他神经网络 CWS 模型中,展现出良好的可迁移性。
  • BERT 的预测揭示了 PKU 数据集中存在标注不一致的问题,特别是在习语表达如“银装素裹”和“至关重要”中,训练集与测试集在词边界上存在分歧。
  • 该模型在处理 OOV(词汇表外)词和多语言句子时表现不佳,表明其在处理罕见字符和混合脚本输入方面存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。