[论文解读] Biomedical named entity recognition using BERT in the machine reading comprehension framework
本文提出了一种基于BioBERT的新型生物医学机器阅读理解(MRC)框架,用于生物医学命名实体识别(BioNER),将序列标注任务重新构塑为问题-回答任务,以更好地利用语义上下文和先验知识。该方法在六个基准数据集上实现了最先进(SOTA)的F1分数,包括在BC5CDR-Chem上达到94.19%,在BC4CHEMD上达到92.92%,优于BioBERT-Softmax和BERT-MRC,通过提升实体边界检测能力并减少标签不一致性,显著提升了性能。
Recognition of biomedical entities from literature is a challenging research focus, which is the foundation for extracting a large amount of biomedical knowledge existing in unstructured texts into structured formats. Using the sequence labeling framework to implement biomedical named entity recognition (BioNER) is currently a conventional method. This method, however, often cannot take full advantage of the semantic information in the dataset, and the performance is not always satisfactory. In this work, instead of treating the BioNER task as a sequence labeling problem, we formulate it as a machine reading comprehension (MRC) problem. This formulation can introduce more prior knowledge utilizing well-designed queries, and no longer need decoding processes such as conditional random fields (CRF). We conduct experiments on six BioNER datasets, and the experimental results demonstrate the effectiveness of our method. Our method achieves state-of-the-art (SOTA) performance on the BC4CHEMD, BC5CDR-Chem, BC5CDR-Disease, NCBI-Disease, BC2GM and JNLPBA datasets, achieving F1-scores of 92.92%, 94.19%, 87.83%, 90.04%, 85.48% and 78.93%, respectively.
研究动机与目标
- 为解决序列标注在BioNER中常未能充分利用语义上下文和先验知识的局限性。
- 通过设计合理的查询,将BioNER重新构塑为机器阅读理解(MRC)任务,以提升性能。
- 通过端到端MRC训练,消除对CRF或条件随机场后处理机制的需求。
- 在多个标准数据集上评估MRC-based BioNER在多样化生物医学实体类型上的有效性。
- 证明MRC框架相较于传统序列标注,能更好地捕捉句法和语义关系。
提出的方法
- 将BioNER任务重新构塑为机器阅读理解(MRC)问题,其中每种实体类型由自然语言查询表示。
- 对于每个输入句子,构建一个查询,以提示模型识别对应特定实体类型的词段(例如:'哪些词是像钠或RA这样的化学品?')。
- 使用跨度预测头对BioBERT进行微调,以预测答案跨度的起始和结束位置。
- 损失函数将起始位置损失和结束位置损失平均结合(即:(Loss_start + Loss_end)/2),避免在通用MRC模型中使用的复杂跨度损失。
- 利用训练数据中的已知实体示例设计查询,以注入先验知识并提升泛化能力。
- 模型采用端到端MRC训练,无需CRF或条件随机场后处理,简化了推理过程。
实验结果
研究问题
- RQ1将BioNER重新构塑为机器阅读理解任务,是否能相比传统序列标注提升性能?
- RQ2使用领域特定查询如何通过注入先验知识来增强模型性能?
- RQ3MRC框架是否相比序列标注能更好地捕捉生物医学文本中的句法和语义关系?
- RQ4在多个数据集上,BioBERT-MRC与BioBERT-Softmax和BERT-MRC在精确率、召回率和F1分数上的表现如何?
- RQ5MRC框架是否能减少标签不一致性并提升BioNER中的边界检测准确率?
主要发现
- BioBERT-MRC在六个生物医学NER数据集上实现了最先进(SOTA)的F1分数,包括在BC5CDR-Chem上达到94.19%,在BC4CHEMD上达到92.92%。
- 该方法显著提升了相对于BioBERT-Softmax的精确率,从而在减少假阳性方面表现更优,F1分数更高。
- 案例研究显示,BioBERT-MRC能够纠正假阴性和假阳性,改善边界检测,并减少标签不一致性。
- 该模型优于BERT-MRC(L),表明BERT-MRC中的跨度损失组件对于平面实体的BioNER任务是不必要的,甚至可能产生负面影响。
- MRC框架促进了更好的句法和语义学习,体现在对短语、片段和实体一致性的处理能力得到提升。
- 未使用CRF后处理并未影响性能,证实了端到端MRC训练的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。