[论文解读] DAG-based Long Short-Term Memory for Neural Word Segmentation
本文提出DAG-LSTM,一种新颖的神经网络架构,通过在词汇表上构建有向无环图(DAG),将词级信息整合到基于字符的序列标注中,用于中文分词。该模型通过在DAG结构化的LSTM中联合学习字符和词嵌入,显著提升了性能,在三个基准数据集上取得最先进结果,尤其在存在 OOV 词时,得益于外部词汇表的使用而表现更优。
Neural word segmentation has attracted more and more research interests for its ability to alleviate the effort of feature engineering and utilize the external resource by the pre-trained character or word embeddings. In this paper, we propose a new neural model to incorporate the word-level information for Chinese word segmentation. Unlike the previous word-based models, our model still adopts the framework of character-based sequence labeling, which has advantages on both effectiveness and efficiency at the inference stage. To utilize the word-level information, we also propose a new long short-term memory (LSTM) architecture over directed acyclic graph (DAG). Experimental results demonstrate that our model leads to better performances than the baseline models.
研究动机与目标
- 通过在不放弃高效序列标注框架的前提下,将词级信息整合到基于字符的神经分词中,以提升性能。
- 通过DAG结构实现精确推理,解决现有基于词的模型在束搜索(beam-search)和词长约束方面的局限性。
- 开发一种针对词表内(in-vocabulary, IV)词的鲁棒正则化策略,以增强对词表外(out-of-vocabulary, OOV)词的泛化能力。
- 在低资源或领域特定场景(如医学或专利文本)中,实现对外部词典的有效利用。
- 在保持推理效率的同时,实现比基线模型更高的分词准确率。
提出的方法
- 构建一个有向无环图(DAG),其中每条边代表来自预定义词汇表的一个词,覆盖字符序列的子序列。
- 设计一种DAG结构化的长短期记忆网络(DAG-LSTM),在每个位置同时利用字符嵌入和来自DAG中入边的词嵌入进行输入处理。
- 在训练过程中引入词表内(IV)词的丢弃策略,以提升对词表外(OOV)词的鲁棒性并增强泛化能力。
- 利用DAG-LSTM同时建模字符与词之间的上下文依赖关系,实现字符和词级表征的联合学习。
- 将模型应用于标准标签(B, M, E, S)的序列标注任务,以检测词边界,同时保持基于字符推理的高效性。
- 使用交叉熵损失端到端训练模型,利用来自外部语料的预训练字符嵌入和词嵌入。
实验结果
研究问题
- RQ1是否可以在不牺牲推理效率的前提下,有效将词级信息整合到基于字符的序列标注框架中用于中文分词?
- RQ2与标准LSTM和二元语法(bi-gram)模型相比,DAG-LSTM在分词准确率和对OOV词的鲁棒性方面表现如何?
- RQ3在包含罕见或专业术语的领域特定文本中,外部词汇表能在多大程度上提升模型性能?
- RQ4所提出的IV词丢弃策略是否能在不依赖OOV词嵌入的情况下,增强模型对OOV词的泛化能力?
- RQ5DAG-LSTM是否能在避免束搜索不精确推理和词长约束的前提下,实现优于现有基于词的模型的性能?
主要发现
- DAG-LSTM模型在MSRA数据集上达到96.47的宏F1分数,优于二元语法基线(95.71)和一元语法基线(94.14)。
- 当使用完整词汇表时,模型在MSRA上达到96.47 F1,在CTB上达到96.31 F1,在PKU上达到95.89 F1,表明在所有数据集上均有稳定提升。
- 当最大词长为4时,模型在MSRA上达到96.26 F1,表明在正确建模下,较长的词对性能有显著贡献。
- 案例研究证实,当使用测试词汇表构建DAG时,模型能正确分词词表内词(如“adulthood”)和OOV词(如“subsidy rate”)。
- 在使用完整词汇表时,IV词丢弃策略使模型在OOV词上的F1达到68.54%,表明对罕见词具有强大的泛化能力。
- 随着词汇表中词汇数量的增加,性能单调提升,在使用全部词汇时达到峰值96.47 F1。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。