[论文解读] Multiple Sclerosis Severity Classification From Clinical Text
本文提出 MS-BERT,一种在 70,000 份去标识化的多发性硬化症(MS)门诊记录上预训练的领域特定 BERT 模型,以及 MSBC,一种利用 MS-BERT 从临床文本中预测 EDSS 和功能系统子评分的分类器。MSBC 实现了最先进性能,相较于先前方法,EDSS 预测的 Macro-F1 提升 0.12(达到 0.88),功能子评分预测的 Macro-F1 提升 0.29(达到 0.63)。
Multiple Sclerosis (MS) is a chronic, inflammatory and degenerative neurological disease, which is monitored by a specialist using the Expanded Disability Status Scale (EDSS) and recorded in unstructured text in the form of a neurology consult note. An EDSS measurement contains an overall "EDSS" score and several functional subscores. Typically, expert knowledge is required to interpret consult notes and generate these scores. Previous approaches used limited context length Word2Vec embeddings and keyword searches to predict scores given a consult note, but often failed when scores were not explicitly stated. In this work, we present MS-BERT, the first publicly available transformer model trained on real clinical data other than MIMIC. Next, we present MSBC, a classifier that applies MS-BERT to generate embeddings and predict EDSS and functional subscores. Lastly, we explore combining MSBC with other models through the use of Snorkel to generate scores for unlabelled consult notes. MSBC achieves state-of-the-art performance on all metrics and prediction tasks and outperforms the models generated from the Snorkel ensemble. We improve Macro-F1 by 0.12 (to 0.88) for predicting EDSS and on average by 0.29 (to 0.63) for predicting functional subscores over previous Word2Vec CNN and rule-based approaches.
研究动机与目标
- 解决从非结构化神经科门诊记录中准确分类 MS 严重程度的挑战,此类记录传统上需要专家解读。
- 克服现有 NLP 模型在应用于 MS 特定临床文本时的局限性,如固定上下文长度、对临床子语言处理能力差,以及去标识化带来的干扰。
- 开发一种具有临床相关性、公开可用的基于 BERT 的模型(MS-BERT),在真实 MS 门诊记录上进行微调,以提升 MS 严重程度预测任务的性能。
- 构建一个稳健的流水线(MSBC),将 MS-BERT 与分类器结合,以高精度预测整体 EDSS 和功能系统子评分。
- 利用基于 Snorkel 的集成方法,实现对未标注临床记录的半监督标注,验证模型作为标注函数在大规模数据扩展中的实用性。
提出的方法
- 采用经筛选的替换策略对临床记录进行去标识化,以保留语义含义并避免破坏 BERT 词汇表的标记(例如,将姓名替换为 'Salamanca' 而非 '[**LAST NAME PLACEHOLDER**]')。
- 基于超过 70,000 份去标识化的 MS 门诊记录,使用掩码语言建模方法对 MS-BERT 进行预训练,起始于 BlueBERT,并在 MS 特定临床语言上进行微调。
- 开发了一种方法,通过聚合长临床记录中多个 512 标记段的子词标记嵌入,生成就诊级别的嵌入,以保留完整上下文信息。
- 构建 MSBC,一种分类器,利用 MS-BERT 嵌入通过多头分类头预测 EDSS 和功能子评分。
- 应用 Snorkel 框架,将 MSBC 与其他标注函数(LFS)结合,为未标注数据生成银标准标签,从而实现半监督训练。
- 在 Snorkel 中使用条件独立性和标签模型推断,估计 LFs 准确率并生成弱标签,同时通过与黄金标准标注的对比验证性能。
实验结果
研究问题
- RQ1在 MS 严重程度分类任务中,基于真实 MS 临床记录训练的领域特定 BERT 模型是否能优于通用模型或基于 MIMIC 的模型?
- RQ2如何在保留上下文语义的同时,对临床文本进行去标识化,以避免破坏 BERT 的标记化?
- RQ3当受限于 Transformer 模型 512 标记的上下文窗口时,如何从长临床记录中构建就诊级别的嵌入?
- RQ4在基于 Snorkel 的集成中,使用强模型(如 MSBC)作为标注函数,是否能相比弱模型或相关 LFs 提升未标注数据上的性能?
- RQ5在银标准标签(通过集成标注生成)上训练的模型,其性能是否能与在黄金标准标签上训练的模型相当或更优?
主要发现
- MSBC 在 EDSS 预测中达到 0.88 的 Macro-F1 分数,相较于先前的 Word2Vec CNN 和基于规则的方法提升了 0.12。
- 在功能子评分预测中,MSBC 达到 0.63 的 Macro-F1,相较于先前方法提升了 0.29。
- MSBC-silver 模型(在 Snorkel 集成生成的银标准标签上训练)在 EDSS 预测任务中优于所有先前基线模型。
- 从 MSBC(0.88 F1)到 MSBC-silver 的性能下降仅为 0.03–0.06,表明标签生成具有强大的泛化能力和自一致性。
- 在所有评估指标中,MSBC 均优于基于规则和 Word2Vec 的模型,定性错误分析显示显著错误极少(EDSS 量表上偏差 ≤1)。
- 由于相关 LFs 的存在,Snorkel 中的条件独立性假设被违反,这可能是将 MSBC 与弱 LFs 结合时性能下降的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。