[论文解读] Claim Extraction in Biomedical Publications using Deep Discourse Model and Transfer Learning
本文提出一个包含1,500篇专家标注的生物医学摘要的新数据集,用于科学主张抽取,并提出一种结合迁移学习的深度话语模型,采用微调后的Bi-LSTM-CRF架构。该方法相较于非迁移学习基线模型,F1得分提升14.1个百分点,证明了迁移学习在科学文献主张抽取中的有效性。
Claims are a fundamental unit of scientific discourse. The exponential growth in the number of scientific publications makes automatic claim extraction an important problem for researchers who are overwhelmed by this information overload. Such an automated claim extraction system is useful for both manual and programmatic exploration of scientific knowledge. In this paper, we introduce a new dataset of 1,500 scientific abstracts from the biomedical domain with expert annotations for each sentence indicating whether the sentence presents a scientific claim. We introduce a new model for claim extraction and compare it to several baseline models including rule-based and deep learning techniques. Moreover, we show that using a transfer learning approach with a fine-tuning step allows us to improve performance from a large discourse-annotated dataset. Our final model increases F1-score by over 14 percent points compared to a baseline model without transfer learning. We release a publicly accessible tool for discourse and claims prediction along with an annotation tool. We discuss further applications beyond biomedical literature.
研究动机与目标
- 为应对生物医学文献中信息过载的日益严峻挑战,通过自动化方式提取科学主张。
- 创建一个大规模、专家标注的1,500篇生物医学摘要数据集,包含句子级别的主张标注。
- 开发一种利用话语结构和预训练语言表征迁移学习的深度学习模型,用于主张抽取。
- 在性能上超越基于规则和非迁移学习的深度学习基线模型,提升主张抽取效果。
提出的方法
- 作者引入一个包含1,500篇生物医学摘要的新数据集,其中每篇摘要均经专家标注主张,每个句子被标记为“是主张”或“否”。
- 采用带有条件随机场(CRF)的Bi-LSTM架构进行序列标注,该模型在话语标注的PubMed数据集上进行预训练。
- 通过在新的主张标注数据集上微调预训练的Bi-LSTM-CRF模型,实现迁移学习,使通用话语表征适应主张检测任务。
- 模型使用预训练词嵌入(GloVe和PubMed专用嵌入),并采用交叉熵损失和CRF解码进行端到端训练。
- 开发了一款标注工具,支持专家标注并进行标注者间一致性检查,确保数据质量。
- 发布了一个公开的网络服务和代码库,包含话语和主张预测的工具。
实验结果
研究问题
- RQ1能否通过大规模话语标注数据集的迁移学习提升生物医学文献中的主张抽取性能?
- RQ2具有迁移学习的深度学习模型与基于规则和非迁移学习的深度学习基线模型相比,在主张抽取中表现如何?
- RQ3预训练词嵌入(如GloVe与PubMed专用嵌入)对主张检测性能有何影响?
- RQ4在结构化摘要上训练的模型在完整科学摘要中的主张检测任务上,其泛化能力如何?
- RQ5所提出的框架能否扩展到生物医学以外的其他科学领域?
主要发现
- 所提出的基于迁移学习的模型相较于无迁移学习的基线模型,F1得分提升了14.1个百分点。
- 该模型在F1得分上比基于规则的方法高出47%,证明了结合迁移学习的深度学习方法具有显著优势。
- 在新主张标注数据集上对Bi-LSTM-CRF模型进行微调显著提升了性能,表明知识迁移有效。
- 使用GloVe词嵌入(300维)的性能优于PubMed专用词向量(200维),可能归因于更大的语料规模和更优的共现建模能力。
- 模型对摘要中后半部分句子的主张标签存在轻微倾向,这在生物医学论文中常见,但可能无法推广到其他领域。
- 作者发布了公开数据集、代码和基于网络的主张与话语预测工具,支持社区扩展与复用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。