[论文解读] Training without training data: Improving the generalizability of automated medical abbreviation disambiguation
本文提出了一种利用生物医学本体(UMLS)和全局上下文建模的数据增强技术,以在不依赖昂贵标注训练数据的情况下提升医学缩写消歧的性能。通过整合相关医学概念和文档级上下文,该方法在CASI数据集上将准确率提升了14%,在i2b2数据集上提升了4%,显著增强了跨数据集的泛化能力,且仅需极少的人工标注。
Abbreviation disambiguation is important for automated clinical note processing due to the frequent use of abbreviations in clinical settings. Current models for automated abbreviation disambiguation are restricted by the scarcity and imbalance of labeled training data, decreasing their generalizability to orthogonal sources. In this work we propose a novel data augmentation technique that utilizes information from related medical concepts, which improves our model's ability to generalize. Furthermore, we show that incorporating the global context information within the whole medical note (in addition to the traditional local context window), can significantly improve the model's representation for abbreviations. We train our model on a public dataset (MIMIC III) and test its performance on datasets from different sources (CASI, i2b2). Together, these two techniques boost the accuracy of abbreviation disambiguation by almost 14% on the CASI dataset and 4% on i2b2.
研究动机与目标
- 解决医学缩写消歧任务中标注训练数据稀缺与不平衡的问题。
- 通过减少对手动标注语料库的依赖,提升模型在独立临床数据集间的泛化能力。
- 通过整合来自UMLS的先验医学知识,增强对罕见或未见缩写的表现能力。
- 探究全局文档上下文对消歧性能的影响,超越局部上下文窗口的限制。
- 开发一种可扩展的、无需标注的自动化方法,适用于现实临床文本中数千个缩写。
提出的方法
- 利用统一医学语言系统(UMLS)识别并整合与罕见或不常见缩写相关的医学概念,以增强训练数据。
- 应用逆向替换(RS)从非结构化临床笔记中生成合成训练样本,以全称作为标签。
- 实施带替换的采样策略与概念增强,以平衡类别分布并改善低频扩展形式的表示。
- 通过结合局部窗口上下文与全局文档级上下文,扩展上下文建模,以丰富嵌入表示。
- 在MIMIC-III数据上训练深度学习模型,并在独立数据集(CASI、i2b2)上进行评估,以检验泛化性能。
- 利用文档集合中TF-IDF加权的词语来指导上下文表示,提升缩写表示的上下文感知能力。
实验结果
研究问题
- RQ1生物医学本体(如UMLS)是否能提升数据增强消歧模型中罕见或未见医学缩写的表现?
- RQ2与仅使用局部上下文相比,整合全局文档上下文是否能显著提升消歧性能?
- RQ3在无额外标注数据的情况下,基于一个数据集(MIMIC-III)训练的模型在无关数据集(CASI、i2b2)上的泛化能力如何?
- RQ4通过UMLS进行概念层面的增强,如何影响通过逆向替换生成的合成训练数据的质量与平衡性?
- RQ5一种完全自动化、无需标注的方法是否能在CASI和i2b2等基准数据集上实现显著的性能提升?
主要发现
- 与基线控制模型相比,所提方法在CASI数据集上的宏平均准确率绝对提升了14%(从62.1%提升至76.0%)。
- 在i2b2数据集上,该方法将宏平均准确率提升了4%(从68.9%提升至72.9%),表明其在异构数据上的强大泛化能力。
- 模型在训练语料库中频率低或未出现的扩展形式的缩写上表现最佳,例如“na”(Narcotics Anonymous)的准确率提升了75%。
- 引入全局上下文使CASI上的性能提升3.1个百分点,i2b2上提升4.0个百分点,证实其在表示学习中的价值。
- Full + global模型在CASI上显著优于Full模型(p < 5e-7),在i2b2上显著优于控制模型(p = 6e-11),经Wilcoxon符号秩检验确认具有统计显著性。
- 该方法可有效扩展至数千个缩写,如在i2b2的403个缩写测试集中所展示,且无需人工标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。