[论文解读] SwellShark: A Generative Model for Biomedical Named Entity Recognition without Labeled Data
SwellShark 构建基于弱监督的生物医学命名实体识别标注器,使用多项式生成模型去噪来自词汇表和启发式的信号,在无需手工标注数据的情况下取得有竞争力的结果。
We present SwellShark, a framework for building biomedical named entity recognition (NER) systems quickly and without hand-labeled data. Our approach views biomedical resources like lexicons as function primitives for autogenerating weak supervision. We then use a generative model to unify and denoise this supervision and construct large-scale, probabilistically labeled datasets for training high-accuracy NER taggers. In three biomedical NER tasks, SwellShark achieves competitive scores with state-of-the-art supervised benchmarks using no hand-labeled training data. In a drug name extraction task using patient medical records, one domain expert using SwellShark achieved within 5.1% of a crowdsourced annotation approach -- which originally utilized 20 teams over the course of several weeks -- in 24 hours.
研究动机与目标
- 减少或消除在生物医学 NER 中对手工标注训练数据的需求
- 将生物医学词典、本体及启发式方法作为弱监督来源
- 自动生成候选实体和标注函数以组装大规模概率训练集
- 用多项式生成模型统一并去噪弱监督以推断实体边界
- 展示在多个生物医学 NER 任务上的可扩展性和快速领域适应
提出的方法
- 自动候选生成以识别文档中潜在的实体提及。
- 通过将词汇表和启发式方法转化为标注函数来自动生成监督。
- 将监督资源转换为多个标注函数的标注函数生成器。
- 一个多项式生成模型,考虑重叠跨度和互斥约束以估计实体边界。
- 基于采样的数据构建,为判别模型(CRF/LSTM-CRF)训练创建概率标签。
- 可扩展性实验,展示在高达 100k 未标注文档下的性能。
实验结果
研究问题
- RQ1自动化候选生成策略在性能上与手工调整生成器相比如何?
- RQ2从词汇资源派生的自动生成监督在生物医学 NER 中有多有效?
- RQ3SwellShark 能否在最少人工输入的情况下使用大规模未标注数据训练出高精度标注器?
- RQ4在 Disease 和 Chemical NER 任务上,弱监督模型能多接近有监督基线?
- RQ5在受限时间内(例如 24 小时)使用 SwellShark 能多快构建一个领域特定的 NER 标注器?
主要发现
- SwellShark 在不使用手工标注训练数据的情况下达到与最先进的有监督基准竞争的分数。
- 在高达 100k 未标注文档下,标注器准确率相比在 ≤1k 文档上训练的同一模型提升最多 6.7%(4.9 F1 点)。
- 在药物名称提取任务中,一位领域专家在 24 小时内构建的标注器的分数与使用 20 支队伍并耗时数周的众包标注方法相比仅相差 5.1%。
- 自动名词短语候选生成可以接近手工调优的性能,且 LSTM-CRF 模型从嵌入中获益,通常在更大未标注数据下收敛更快。
- 对跨度集依赖(互斥性)的建模在某些设置中将 F1 提升最多 4.7%(3.4 个点)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。