[论文解读] Biomedical Named Entity Recognition via Reference-Set Augmented Bootstrapping
本文提出一种弱监督、参考集增强的自举方法,以在极少标注数据下提升生物医学命名实体识别(NER)性能。通过结合少量完全标注的种子样本、来自UniProt的高精度参考集匹配结果,以及神经NER模型迭代优化的软标签,该方法在F1分数上达到79.75%(BiLSTM+CRF),接近使用30倍以上标注数据训练的模型性能。
We present a weakly-supervised data augmentation approach to improve Named Entity Recognition (NER) in a challenging domain: extracting biomedical entities (e.g., proteins) from the scientific literature. First, we train a neural NER (NNER) model over a small seed of fully-labeled examples. Second, we use a reference set of entity names (e.g., proteins in UniProt) to identify entity mentions with high precision, but low recall, on an unlabeled corpus. Third, we use the NNER model to assign weak labels to the corpus. Finally, we retrain our NNER model iteratively over the augmented training set, including the seed, the reference-set examples, and the weakly-labeled examples, which improves model performance. We show empirically that this augmented bootstrapping process significantly improves NER performance, and discuss the factors impacting the efficacy of the approach.
研究动机与目标
- 解决因标注成本高和专家标注数据稀缺导致的低资源生物医学NER挑战。
- 通过利用外部知识库和模型预测的弱监督,减少对大规模完全标注数据集的依赖。
- 通过结合参考集匹配与模型预测标签的迭代式数据增强框架,提升生物医学文献中的NER性能。
- 研究噪声标注的影响,并证明迭代优化可缓解低精度弱标签带来的性能下降。
提出的方法
- 在小规模完全标注种子数据集($\mathcal{D}_s$)上训练初始神经NER(NNER)模型。
- 使用参考集(如UniProt)通过精确或部分、不区分大小写的匹配,在未标注语料($\mathcal{D}_c$)中识别高精度、低召回率的实体提及。
- 将初始NNER模型应用于未标注语料,预测软标签(0到1之间的概率),生成弱标注样本。
- 将种子数据、参考集匹配结果与预测标签合并,形成增强的训练集,用于重新训练NNER模型。
- 通过增强数据集迭代重新训练NNER模型,每次迭代中优化软标签预测,以提升模型鲁棒性与性能。
- 应用提升精度的启发式规则优化参考集匹配(如过滤短名称、词典词和缩写),以减少噪声并提升标签质量。
实验结果
研究问题
- RQ1能否有效利用UniProt等外部数据库的参考集匹配结果,在不降低性能的前提下增强生物医学NER中的弱标注数据?
- RQ2在结合噪声预测与高精度参考集匹配时,迭代软标签优化对模型性能有何影响?
- RQ3参考集匹配中的哪些因素(如大小写敏感性、名称长度、词典词)显著影响弱标签质量与整体NER性能?
- RQ4弱监督自举方法在在多大程度上可减少对大规模人工标注的依赖,同时保持生物医学NER中的高F1分数?
主要发现
- 所提方法在BiLSTM+CRF模型上实现79.75%的F1分数,接近使用30倍以上标注数据训练的完全监督模型性能。
- 迭代标签优化将弱监督模型与完全监督基线之间的F1分数差距从25个百分点降低至4个百分点。
- 简单的参考集匹配方式(如精确、区分大小写的匹配)导致精度较低(59.23%),损害模型性能,初始实验中F1降至71.33%。
- 应用提升精度的过滤策略(如移除短名称、词典词和缩写)使参考集精度提升至90.20%,BiLSTM+CRF的F1提升至77.70%。
- 迭代优化过程带来持续的性能提升:BiLSTM+CRF的F1从第0轮的74.28%提升至第7轮的78.83%,证明对噪声标签具有鲁棒性。
- 在迭代自举循环中整合种子数据、参考集匹配与模型预测标签,使模型即使在各组件本身存在噪声的情况下,仍能有效泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。