[论文解读] Quantification of BERT Diagnosis Generalizability Across Medical Specialties Using Semantic Dataset Distance
本研究利用MIMIC-III电子健康记录(EHR)数据中的语义数据集距离(MCD),评估基于BERT的自然语言处理(NLP)模型在不同医学专科间的泛化能力。研究发现,通过在多个专科上进行训练的模型泛化能力更强,其性能与训练集和测试集之间的语义相似度密切相关;当在不同专科间进行测试时,模型AUC从内部测试的0.92下降至外部测试的0.83。
Deep learning models in healthcare may fail to generalize on data from unseen corpora. Additionally, no quantitative metric exists to tell how existing models will perform on new data. Previous studies demonstrated that NLP models of medical notes generalize variably between institutions, but ignored other levels of healthcare organization. We measured SciBERT diagnosis sentiment classifier generalizability between medical specialties using EHR sentences from MIMIC-III. Models trained on one specialty performed better on internal test sets than mixed or external test sets (mean AUCs 0.92, 0.87, and 0.83, respectively; p = 0.016). When models are trained on more specialties, they have better test performances (p < 1e-4). Model performance on new corpora is directly correlated to the similarity between train and test sentence content (p < 1e-4). Future studies should assess additional axes of generalization to ensure deep learning models fulfil their intended purpose across institutions, specialties, and practices.
研究动机与目标
- 评估基于BERT的诊断情感分类器在电子健康记录(EHR)笔记中跨不同医学专科的泛化能力。
- 探究在多个专科间增加训练数据多样性是否能提升模型泛化能力。
- 量化语义数据集距离(MCD)与模型在未见测试集上性能之间的关系。
- 评估当前NLP模型在处理不同专科和机构间笔记风格差异方面的局限性。
- 为预测新、未见医学语料中模型性能,提供一个定量指标(MCD)
提出的方法
- 使用包含贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)ICU单元超过200万条笔记的MIMIC-III EHR数据集。
- 利用ICD-10和TCGA疾病列表,从三个专科(肿瘤学、心脏病学和肺病学)中提取2,955个包含诊断术语的句子。
- 通过SpaCy进行分词和句子分割预处理,随后使用SciBERT生成语义表示。
- 将训练集与测试集句子嵌入向量之间的平均余弦距离(MCD)作为数据集相似性的代理指标。
- 在包含一个、两个或全部三个专科的训练集上微调基于BERT的情感分类器,并在内部、部分和外部测试集上评估AUC。
- 使用t-SNE可视化确认笔记类型和语义相似度是嵌入空间中的主要信号。
实验结果
研究问题
- RQ1当在MIMIC-III中对同一专科(内部)与不同专科(外部)的数据进行测试时,模型性能如何变化?
- RQ2在多个专科间增加训练数据多样性在多大程度上能改善模型泛化能力?
- RQ3语义数据集距离(MCD)在多大程度上能预测模型在未见测试集上的性能?
- RQ4笔记类型在跨专科的嵌入相似度和模型泛化中起什么作用?
- RQ5MCD能否作为临床NLP中预测NLP模型泛化能力的数据集相似性可靠代理?
主要发现
- 在单一专科上训练的模型在内部测试集上的平均AUC为0.92,但在混合专科测试集上下降至0.87,在外部专科测试集上进一步降至0.83(p = 0.016)。
- 在多个专科间增加训练集多样性显著提升了测试性能(p < 1e-4),表明更广泛的数据能带来更好的泛化能力。
- 模型性能与训练集和测试集之间的语义数据集距离(MCD)高度相关(p < 1e-4),表明MCD是泛化能力的可靠预测指标。
- 肿瘤学专科的出院总结笔记占比过高(68%),可能因笔记类型偏差而人为提高了在肿瘤学测试集上的表现。
- MCD有效捕捉了数据集相似性的差异,内部配对的MCD低于外部配对,尽管MCD可能过于简化了复杂的相似性分布。
- 本研究强调,笔记类型是嵌入空间中的主导信号,可能混淆语义相似度,从而影响泛化性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。