[论文解读] The Uncertainty-based Retrieval Framework for Ancient Chinese CWS and POS
本文提出了一种基于不确定性的检索框架,用于古汉语分词(CWS)与词性标注(POS)任务,通过引入双词特征增强BERT以捕捉局部语义,并利用外部知识对不确定的片段进行重预测。该方法在《左传》数据集上优于BERT-CRF与Jiayan,CWS的F1达到96.28%,POS的F1达到92.41%。
Automatic analysis for modern Chinese has greatly improved the accuracy of text mining in related fields, but the study of ancient Chinese is still relatively rare. Ancient text division and lexical annotation are important parts of classical literature comprehension, and previous studies have tried to construct auxiliary dictionary and other fused knowledge to improve the performance. In this paper, we propose a framework for ancient Chinese Word Segmentation and Part-of-Speech Tagging that makes a twofold effort: on the one hand, we try to capture the wordhood semantics; on the other hand, we re-predict the uncertain samples of baseline model by introducing external knowledge. The performance of our architecture outperforms pre-trained BERT with CRF and existing tools such as Jiayan.
研究动机与目标
- 解决因语料稀疏和词语含义丰富而导致的低资源、模糊的古汉语文本处理挑战。
- 通过捕捉局部词性语义而不依赖大规模人工整理的词典,提升CWS与POS标注的性能。
- 通过MC-dropout识别不确定片段并利用外部知识重预测,降低预测模糊性。
- 构建一个两阶段框架,结合语义增强与知识融合,以提升模型的鲁棒性与准确性。
提出的方法
- 通过拼接相邻字符的隐藏表示,将双词特征融入BERT,以捕捉局部词性语义。
- 应用线性融合层,将BERT的标记表示与双词特征结合,生成复合向量。
- 使用MC-dropout估计预测不确定性,并识别需重新处理的模糊字符。
- 检索辅助知识,并使用[SEP]标记构建知识增强的输入序列,以整合外部信息。
- 在组合输入与初步标签上训练知识融合BERT(KF-BERT)模型,对不确定标记进行掩码。
- 对融合后的输出使用Viterbi解码进行最终预测,当存在多个不确定片段时取结果平均值。
实验结果
研究问题
- RQ1双词特征是否能在不依赖大规模词典的前提下,有效捕捉古汉语中的局部词性语义?
- RQ2通过MC-dropout进行不确定采样,是否能有效提升对古汉语中模糊片段的识别能力?
- RQ3知识检索与融合是否能显著提升在低资源古汉语设置下的CWS与POS标注性能?
- RQ4所提出的两阶段框架与BERT-CRF、Jiayan等强基线模型相比,在标准古汉语基准上的表现如何?
主要发现
- 所提框架在《左传》数据集上取得96.284%的CWS-F1与92.410%的POS-F1,优于Siku-RoBERTa + CRF(96.073%与91.998%)及Jiayan(CWS为82.022%,POS为83.141%)。
- 引入双词特征的语义增强BERT(SE-BERT)性能优于标准BERT-Bigram,表明学习得到的双词特征比预训练特征更有效。
- 知识融合阶段显著提升了性能,SE-BERT + KF-BERT在CWS与POS任务中均取得最高F1分数。
- 消融实验表明,语义增强与知识融合对最终性能提升具有独立且协同的作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。