Skip to main content
QUICK REVIEW

[论文解读] Seeing The Whole Patient: Using Multi-Label Medical Text Classification Techniques to Enhance Predictions of Medical Codes

Vithya Yogarajan, Jacob Montiel|arXiv (Cornell University)|Mar 29, 2020
Biomedical Text Mining and Ontologies参考文献 40被引用 4
一句话总结

本文提出使用高维、面向健康领域的词嵌入——特别是600维的Skip-gram模型——以改进多标签医疗文本分类,用于预测多病共存患者的ICD-9编码。结果表明,此类嵌入显著提升了F1值,尤其在罕见医疗编码上表现突出,且在去标识化电子健康记录(EHR)数据上,文本预处理带来的收益微乎其微。

ABSTRACT

Machine learning-based multi-label medical text classifications can be used to enhance the understanding of the human body and aid the need for patient care. We present a broad study on clinical natural language processing techniques to maximise a feature representing text when predicting medical codes on patients with multi-morbidity. We present results of multi-label medical text classification problems with 18, 50 and 155 labels. We compare several variations to embeddings, text tagging, and pre-processing. For imbalanced data we show that labels which occur infrequently, benefit the most from additional features incorporated in embeddings. We also show that high dimensional embeddings pre-trained using health-related data present a significant improvement in a multi-label setting, similarly to the way they improve performance for binary classification. High dimensional embeddings from this research are made available for public use.

研究动机与目标

  • 通过多标签文本分类技术,提升多病共存患者中多个并发医疗编码(ICD-9)的预测性能。
  • 探究不同嵌入技术——特别是嵌入维度与架构(Skip-gram与CBOW)——对不平衡医疗文本数据性能的影响。
  • 评估对自由格式临床文本进行预处理(如分词、截断)对分类性能的影响,尤其在去标识化数据集(如MIMIC-III)中的表现。
  • 评估不同标记策略(如词性标注、文本分段标记)和分类器配置在多标签医疗自然语言处理任务中的影响。
  • 为临床自然语言处理研究提供公开可用、高质量、预训练的医疗文本嵌入。

提出的方法

  • 在MIMIC-III数据集的去标识化临床笔记上,使用Skip-gram和CBOW模型训练词嵌入,嵌入维度分别为300和600,并采用不同的预训练策略。
  • 采用基于逻辑回归与弹性网络正则化(ECC)的多标签分类框架,作为预测ICD-9编码的基础分类器。
  • 探索多种嵌入变体:W300(Word2Vec)、T300/T600(fastText,300/600维)、CONCAT300/350(拼接嵌入),以及带有词性标注或文本分段标记的嵌入。
  • 采用微观和宏观F1分数评估在18、50和155个ICD-9编码标签下的性能,并按标签频率进行独立分析。
  • 对比经预处理的文本(分词后,截断至2500个词)与原始文本,评估在去标识化EHR中预处理的实用性。
  • 通过消融研究分析标记方法与嵌入类型,以隔离特定设计选择带来的性能提升。

实验结果

研究问题

  • RQ1不同嵌入架构(如Skip-gram与CBOW)对罕见与常见ICD-9编码的多标签医疗文本分类性能有何影响?
  • RQ2提升嵌入维度(如300维与600维)在多大程度上能改善F1值,特别是在发生频率较低的医疗编码上?
  • RQ3对自由格式临床文本进行预处理(如分词、截断)是否能带来可测量的F1值提升,相比使用原始文本?
  • RQ4不同标记策略(如词性标注、文本分段标记)如何影响多标签医疗文本分类模型的性能?
  • RQ5组合多种嵌入类型(如CONCAT300)对多病共存预测任务的整体分类性能有何影响?

主要发现

  • 600维嵌入的Skip-gram模型(T600SG)在所有标签集(18、50、155)中均达到最高的微观与宏观F1分数,在155标签任务中宏观F1达0.674。
  • 对于罕见ICD-9编码,如410.71(F1从0.332提升至0.404)和410.70(从0.329提升至0.404),高维嵌入(T600SG)带来了最大的相对性能提升。
  • 对临床文本进行预处理(如截断至2500个词或标准分词)相比使用原始文本,仅带来微小的F1值提升,表明在已去标识化的数据上预处理收益有限。
  • T300嵌入在所有标签集中均优于W300,宏观F1分别提升0.005(18个标签)、0.011(50个标签)和0.013(155个标签),表明高维嵌入始终更优。
  • 使用文本分段标记(T300, TextSplitTag)使155标签任务的宏观F1提升至0.684,优于标准词性标注(0.646),表明结构化标记可增强表征能力。
  • 表现最佳的模型(T600SG)在155标签任务中达到微观F1 0.745和宏观F1 0.674,表明高维、面向医疗的优化嵌入能显著提升多病共存场景下的多标签预测性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。