[论文解读] Incorporating Dictionaries into Deep Neural Networks for the Chinese Clinical Named Entity Recognition
本文提出将临床词典集成到深度神经网络中,用于中文临床命名实体识别(CNER),从而提升对罕见及未见实体的识别性能。通过在Bi-LSTM-CRF基础上扩展五种特征表示方案及两种融合字符级嵌入与词典衍生特征的架构,该方法在CCKS-2017基准测试中取得了91.24%的F1分数,优于当前最先进模型。
Clinical Named Entity Recognition (CNER) aims to identify and classify clinical terms such as diseases, symptoms, treatments, exams, and body parts in electronic health records, which is a fundamental and crucial task for clinical and translational research. In recent years, deep neural networks have achieved significant success in named entity recognition and many other Natural Language Processing (NLP) tasks. Most of these algorithms are trained end to end, and can automatically learn features from large scale labeled datasets. However, these data-driven methods typically lack the capability of processing rare or unseen entities. Previous statistical methods and feature engineering practice have demonstrated that human knowledge can provide valuable information for handling rare and unseen cases. In this paper, we address the problem by incorporating dictionaries into deep neural networks for the Chinese CNER task. Two different architectures that extend the Bi-directional Long Short-Term Memory (Bi-LSTM) neural network and five different feature representation schemes are proposed to handle the task. Computational results on the CCKS-2017 Task 2 benchmark dataset show that the proposed method achieves the highly competitive performance compared with the state-of-the-art deep learning methods.
研究动机与目标
- 解决深度学习模型在中文电子健康记录(EHR)中识别罕见或未见临床实体的局限性。
- 将人工整理的临床词典集成到深度神经网络中,以提升模型在训练数据之外的泛化能力。
- 设计有效的特征表示方案,将词典知识与上下文字符特征相结合。
- 在标准基准(CCKS-2017任务2)上评估所提方法,并与当前最先进深度学习模型进行比较。
- 探究词典大小与LSTM隐藏单元数量对模型性能的影响。
提出的方法
- 将Bi-LSTM-CRF架构扩展至字符级别,用于中文CNER。
- 提出五种不同的特征表示方案(PDET、PDET+、PDET++、PDET-1、PDET-2),用于编码每个字符的基于词典的特征。
- 引入两种网络架构(Model-I与Model-II),以整合字符嵌入与词典衍生的特征向量。
- 将字符嵌入与词典特征拼接后作为LSTM层的输入,用于序列标注。
- 在Bi-LSTM之上使用条件随机场(CRF)建模标签依赖关系,以提高序列标注的准确性。
- 采用网格搜索与交叉验证对超参数进行调优,包括词典大小与LSTM隐藏单元数量。
实验结果
研究问题
- RQ1将临床词典集成到深度神经网络中,能否提升中文EHR中罕见及未见临床实体的识别效果?
- RQ2不同的基于词典的特征表示方案如何影响Bi-LSTM-CRF模型在中文CNER中的性能?
- RQ3在序列标注任务中,融合字符级嵌入与词典衍生特征的最佳架构是什么?
- RQ4临床词典的大小如何影响模型在CCKS-2017基准上的性能表现?
- RQ5LSTM隐藏单元数量对所提框架中模型准确率与泛化能力有何影响?
主要发现
- 所提方法在CCKS-2017任务2基准上取得了91.24%的F1分数,优于先前最先进模型。
- 采用PDET特征与Model-I架构的模型表现最佳,尽管仅使用单一模型,其F1分数仍较Hu等[39]高出0.16%。
- 随着词典规模增大,性能稳步提升,表明更大的词典有助于识别罕见实体。
- 当LSTM层隐藏单元数达到256时,模型性能达到峰值,继续增加则导致过拟合并引起性能下降。
- 与基于词级别的方法相比,采用字符级建模并融合词典信息可显著减少边界错误。
- 由于显式引入人工整理的临床知识,该方法在未见实体上表现出强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。