Skip to main content
QUICK REVIEW

[论文解读] A Gap-Based Framework for Chinese Word Segmentation via Very Deep Convolutional Networks

Zhiqing Sun, Gehui Shen|arXiv (Cornell University)|Dec 27, 2017
Natural Language Processing Techniques参考文献 25被引用 9
一句话总结

该论文提出了一种基于间隙的中文分词框架,通过使用非常深的卷积神经网络(ResNets 和 DenseNets),直接在字符间隙处预测分词决策,无需后处理或束搜索,在五个基准测试上实现了最先进性能,优于纯监督设置下的基于字符和基于词的方法。

ABSTRACT

Most previous approaches to Chinese word segmentation can be roughly classified into character-based and word-based methods. The former regards this task as a sequence-labeling problem, while the latter directly segments character sequence into words. However, if we consider segmenting a given sentence, the most intuitive idea is to predict whether to segment for each gap between two consecutive characters, which in comparison makes previous approaches seem too complex. Therefore, in this paper, we propose a gap-based framework to implement this intuitive idea. Moreover, very deep convolutional neural networks, namely, ResNets and DenseNets, are exploited in our experiments. Results show that our approach outperforms the best character-based and word-based methods on 5 benchmarks, without any further post-processing module (e.g. Conditional Random Fields) nor beam search.

研究动机与目标

  • 为解决基于字符和基于词的神经模型在中文分词中的局限性,提出一种更简单、更直观的框架。
  • 通过直接在字符之间的间隙建模分词决策,消除对 CRF 或结构化推理等后处理模块的需求。
  • 利用非常深的卷积神经网络(ResNets 和 DenseNets)更有效地捕捉层次化的字符组合特征,优于浅层模型。
  • 建立一种新的端到端基线方法用于 CWS,兼具高效与高效率,优于现有最先进监督方法。

提出的方法

  • 该模型将中文分词视为在连续字符之间的每个间隙处的二分类任务,预测是否存在词边界。
  • 为一元组和二元组字符特征分别使用学习得到的嵌入表示,将其拼接后作为深层网络的输入。
  • 采用非常深的残差块和密集块以提取多层次的字符组合特征,从而实现更好的梯度流动和特征重用。
  • 该框架采用全卷积结构,不包含循环或转移相关组件,支持端到端训练与推理。
  • 模型通过在间隙级别预测上使用交叉熵损失进行训练,避免结构化预测或解码步骤。
  • 该架构受到现代计算机视觉模型(ResNet、DenseNet)的启发,将它们的残差连接与密集连接模式应用于序列分词任务。

实验结果

研究问题

  • RQ1基于间隙的直接预测框架是否能在中文分词任务中超越传统的基于字符和基于词的神经模型?
  • RQ2使用非常深的卷积神经网络(ResNets 和 DenseNets)是否能提升特征表示能力并提高 CWS 的分词准确率?
  • RQ3端到端框架是否能消除对 CRF 或束搜索等后处理模块的需求,同时保持或提升性能?
  • RQ4该基于间隙的方法在多个基准测试上与最先进监督及半监督模型相比表现如何?

主要发现

  • 所提出的基于间隙的框架在全部五个基准测试(CTB6、PKU、MSR、AS 和 CityU)上均取得了最先进性能,超越了以往最佳的监督方法。
  • 在 CTB6 上,该模型取得了 97.45 的 F1 分数,创下纯监督模型的新 SOTA 记录。
  • 在 SIGHAN 2005 基准测试(PKU、MSR、AS、CityU)上,该模型优于所有先前基于字符和基于词的方法,包括使用 CRF 或束搜索的方法。
  • 在 CTB6、AS 和 CityU 上,该模型与最佳半监督方法相比表现相当,展现出强大的泛化能力。
  • 使用非常深的网络(ResNet 和 DenseNet 块)带来了显著的性能提升,证实更深的架构对 CWS 有益。
  • 该框架消除了对复杂后处理或解码机制的需求,简化了训练与推理过程,同时保持了高精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。