Skip to main content
QUICK REVIEW

[论文解读] Unified Multi-Criteria Chinese Word Segmentation with BERT

Zhen Ke, Liang Shi|arXiv (Cornell University)|Apr 13, 2020
Natural Language Processing Techniques参考文献 21被引用 13
一句话总结

本文提出一种统一的基于 BERT 的多准则中文分词(MCCWS)模型,将 BERT 的上下文表征与二元语法特征及辅助准则分类任务相结合。该方法通过统一框架共享表征,在八个数据集上实现了最先进性能,优于先前的多任务和统一模型,且无需 CRF 解码。

ABSTRACT

Multi-Criteria Chinese Word Segmentation (MCCWS) aims at finding word boundaries in a Chinese sentence composed of continuous characters while multiple segmentation criteria exist. The unified framework has been widely used in MCCWS and shows its effectiveness. Besides, the pre-trained BERT language model has been also introduced into the MCCWS task in a multi-task learning framework. In this paper, we combine the superiority of the unified framework and pretrained language model, and propose a unified MCCWS model based on BERT. Moreover, we augment the unified BERT-based MCCWS model with the bigram features and an auxiliary criterion classification task. Experiments on eight datasets with diverse criteria demonstrate that our methods could achieve new state-of-the-art results for MCCWS.

研究动机与目标

  • 解决在多个不同准则下同时对中文文本进行分词的挑战。
  • 通过结合统一框架与预训练 BERT 表征的优势,提升 MCCWS 性能。
  • 通过整合二元语法特征与辅助准则分类头,增强模型泛化能力与 OOV 词处理能力。
  • 通过端到端学习与并行计算,消除对 CRF 解码的依赖。
  • 与多任务学习方法相比,建立更高效、更有效的 MCCWS 框架。

提出的方法

  • 通过添加特殊准则标记(如 <pku>)增强输入句子,以使 BERT 编码器根据目标分词准则进行条件化处理。
  • 使用 BERT 将增强后的输入编码为上下文表征,捕捉丰富的语言先验信息。
  • 将字符级别的二元语法特征(如 '李娜')转换为可学习嵌入,以捕捉局部字符组合模式。
  • 采用融合门机制将 BERT 的隐藏表征与二元语法嵌入结合,生成更丰富的输入表征。
  • 应用多头注意力层,增强融合表征之间的上下文交互。
  • 使用多层感知机(MLP)解码器预测 CWS 标签(B/M/E/S),无需 CRF,实现高效的并行推理。

实验结果

研究问题

  • RQ1与多任务学习相比,结合 BERT 的统一框架是否能提升多准则中文分词的性能?
  • RQ2二元语法特征在提升分词准确率方面有多有效,尤其是在罕见或 OOV 词上?
  • RQ3添加辅助准则分类头是否能提升模型对不同分词准则的区分能力?
  • RQ4统一的 BERT 基础模型是否能在无需 CRF 解码的情况下实现最先进性能,同时保持高效率?
  • RQ5该模型在不同分词准则下对未登录词的泛化能力如何?

主要发现

  • 所提出的统一 BERT 模型在全部八个标准 MCCWS 数据集上均取得新的最先进 F1 分数,平均 F1 达 97.204,优于先前所有方法,包括多任务 BERT 和基于 Transformer 的统一模型。
  • 不使用二元语法特征的模型(‘- Bigram’)平均 F1 为 97.139,表明二元语法特征对性能提升具有显著贡献。
  • 不使用辅助准则分类头的模型(‘- CLS’)平均 F1 为 97.126,表明辅助任务通过增强准则感知表征学习进一步提升了性能。
  • 在 OOV 词召回方面,完整模型在八个数据集中的五个上达到最佳或接近最佳结果,表明其对罕见和未见词具有强大的泛化能力。
  • 该模型在平均 F1 和 OOV 召回率上均优于此前最佳方法 Multi-Task BERT,证实了统一框架与 BERT 结合的有效性。
  • 由于完全支持并行化,无需 CRF 解码,推理速度更快、效率更高,使模型更适合实时应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。