[论文解读] Intelligent Word Embeddings of Free-Text Radiology Reports
本文提出一种混合方法,结合语义词典映射与word2vec,从自由文本放射科报告中生成密集且具备领域感知的词嵌入。该方法在分类颅内出血诊断置信度时达到88.64%的加权精确率和90.42%的加权召回率,优于基线方法,并在处理放射科特有语言变体方面表现出强鲁棒性。
Radiology reports are a rich resource for advancing deep learning applications in medicine by leveraging the large volume of data continuously being updated, integrated, and shared. However, there are significant challenges as well, largely due to the ambiguity and subtlety of natural language. We propose a hybrid strategy that combines semantic-dictionary mapping and word2vec modeling for creating dense vector embeddings of free-text radiology reports. Our method leverages the benefits of both semantic-dictionary mapping as well as unsupervised learning. Using the vector representation, we automatically classify the radiology reports into three classes denoting confidence in the diagnosis of intracranial hemorrhage by the interpreting radiologist. We performed experiments with varying hyperparameter settings of the word embeddings and a range of different classifiers. Best performance achieved was a weighted precision of 88% and weighted recall of 90%. Our work offers the potential to leverage unstructured electronic health record data by allowing direct analysis of narrative clinical notes.
研究动机与目标
- 为解决由于自然语言模糊性和变异性导致从非结构化放射科报告中提取有意义信息的挑战。
- 通过结合领域特定的语义词典与无监督的word2vec嵌入,改进放射科中的词表示。
- 实现在颅内出血诊断置信度水平上对放射科报告进行自动化、高精度分类。
- 为下游临床NLP应用在放射学领域创建一个可重用、公开发布的嵌入模型。
- 评估语义映射对低词汇量、高专业化领域中词嵌入质量与分类性能的影响。
提出的方法
- 从PACS数据库中检索10,000份头部CT放射科报告,用于训练词嵌入。
- 通过使用领域特定的语义词典对文本进行清洗、分词和标准化处理。
- 应用经过超参数调优(窗口大小、向量维度)的word2vec以生成密集词向量。
- 将语义词典映射与word2vec结合,以改善罕见词或未登录词(OOV)的表示。
- 通过词向量的平均池化生成报告级嵌入,并将其作为分类器的输入特征。
- 在1,188份经标注的报告子集(含黄金标准置信度标签)上训练并评估多种分类器(随机森林、KNN、SVM)。
实验结果
研究问题
- RQ1与仅使用标准word2vec相比,结合语义词典映射与word2vec是否能提升放射科报告的词嵌入质量?
- RQ2所提出的混合嵌入方法在按颅内出血诊断置信度分类放射科报告方面的有效性如何?
- RQ3与基线的unigram特征相比,引入领域特定的语义映射是否显著提升分类性能?
- RQ4超参数选择(窗口大小、向量维度)如何影响嵌入与分类流程的性能?
- RQ5该方法在放射科医生术语使用与报告风格差异下的泛化能力如何?
主要发现
- 混合方法在使用730维词向量的随机森林模型中达到89.08%的加权F1分数,显著优于基线unigram方法(F1 = 75.26%)。
- 随机森林在测试集上达到最高的性能,加权精确率为88.64%,加权召回率为90.42%。
- KNN(n=10)使用仅130维向量即达到相近性能(精确率88.60%,召回率89.91%),表明对维度变化具有鲁棒性。
- 所有模型中,领域特定的语义映射均一致提升了分类器性能,尽管由于领域范围狭窄(单一机构),增益较为有限。
- 所提出方法通过利用语义映射降低了未登录词(OOV)的影响,提升了罕见或变体术语的嵌入质量。
- 作者已将训练好的词嵌入在https://github.com/imonban/RadiologyReportEmbedding公开发布,供临床NLP应用中重用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。