[论文解读] Lexicon Enhanced Chinese Sequence Labeling Using BERT Adapter
本文提出Lexicon Enhanced BERT(LEBERT),一种通过新型Lexicon Adapter层将外部词典知识整合到BERT底层的新方法,实现离散词典特征与上下文表征的深度融合。LEBERT通过在字符级别动态关注相关词典词汇,在十项中文序列标注数据集(涵盖命名实体识别、分词和词性标注任务)上实现最先进性能。
Lexicon information and pre-trained models, such as BERT, have been combined to explore Chinese sequence labelling tasks due to their respective strengths. However, existing methods solely fuse lexicon features via a shallow and random initialized sequence layer and do not integrate them into the bottom layers of BERT. In this paper, we propose Lexicon Enhanced BERT (LEBERT) for Chinese sequence labelling, which integrates external lexicon knowledge into BERT layers directly by a Lexicon Adapter layer. Compared with the existing methods, our model facilitates deep lexicon knowledge fusion at the lower layers of BERT. Experiments on ten Chinese datasets of three tasks including Named Entity Recognition, Word Segmentation, and Part-of-Speech tagging, show that LEBERT achieves the state-of-the-art results.
研究动机与目标
- 为解决中文序列标注中词边界感知能力有限的问题,通过整合结构化词典知识。
- 克服现有词典-BERT融合方法中浅层、随机初始化融合层的局限性。
- 在BERT层级别而非模型头部实现词典特征与BERT表征的深度、交互式融合。
- 通过更优的特征融合,提升中文命名实体识别、分词和词性标注中的跨度边界检测与跨度类型分类性能。
- 通过微调BERT并结合可学习适配器机制,实证验证底层词典知识融合的有效性。
提出的方法
- 引入词典适配器,利用字符到词的双线性注意力机制,为每个字符动态提取预定义词典中的相关词汇。
- 将适配器插入BERT中相邻的Transformer层之间,实现在网络全程中词典特征与上下文表征的持续交互。
- 将外部词典特征与输入字符匹配,形成字符-词对序列,从而在输入中引入词级知识。
- 通过端到端联合微调,同时优化BERT参数与词典适配器参数,以实现特征对齐。
- 适配器在多个层(如第1、3、6、9、12层)插入,消融实验评估融合深度的影响。
- 通过共享相同的适配器与BERT主干网络,支持命名实体识别、分词与词性标注的多任务学习。
实验结果
研究问题
- RQ1与模型级融合相比,将词典特征集成到BERT底层是否能提升中文序列标注任务的性能?
- RQ2词典适配器插入的深度(如第1层与所有层)如何影响序列标注性能?
- RQ3在通过适配器集成词典特征时,微调BERT参数是否必不可少,还是固定BERT即可?
- RQ4底层融合是否能同时提升中文命名实体识别中的跨度边界检测与跨度类型分类性能?
- RQ5在多样化的中文NLP任务中,LEBERT相较于现有方法在鲁棒性与泛化能力方面表现如何?
主要发现
- LEBERT在涵盖命名实体识别、分词与词性标注三类任务的全部十个基准数据集上均达到最先进性能。
- 在第一个Transformer层后应用词典适配器可获得最佳性能,在Ontonotes数据集上F1得分为82.08,优于更深层次融合设置。
- 与固定BERT相比,联合微调BERT参数与词典适配器使Ontonotes数据集的F1得分提升7.03个百分点(从75.05提升至82.08),证明联合优化的必要性。
- 模型正确将实体类型'Hulunbuir League'识别为GPE,而BERT+Word因受无关词'七和八'干扰而误判。
- 在词性标注示例中,LEBERT正确将'七和八'预测为'adj',而BERT与BERT+Word错误分类为'NUM',表明其语义理解能力更优。
- 消融实验确认,多层适配器应用会降低性能,可能由于过拟合或特征信号冲突。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。