[论文解读] Towards Semi-Structured Automatic ICD Coding via Tree-based Contrastive Learning
本文提出了一种新颖的半结构化自动ICD编码框架,首先自动将临床笔记分割为不同部分,然后通过基于树编辑距离的软多标签相似性度量,应用基于树的对比学习以减少数据变异性。该方法通过对比预训练和掩码部分训练增强现有ICD编码模型,在MIMIC-III基准测试中取得显著性能提升,尤其在低数据场景下表现突出。
Automatic coding of International Classification of Diseases (ICD) is a multi-label text categorization task that involves extracting disease or procedure codes from clinical notes. Despite the application of state-of-the-art natural language processing (NLP) techniques, there are still challenges including limited availability of data due to privacy constraints and the high variability of clinical notes caused by different writing habits of medical professionals and various pathological features of patients. In this work, we investigate the semi-structured nature of clinical notes and propose an automatic algorithm to segment them into sections. To address the variability issues in existing ICD coding models with limited data, we introduce a contrastive pre-training approach on sections using a soft multi-label similarity metric based on tree edit distance. Additionally, we design a masked section training strategy to enable ICD coding models to locate sections related to ICD codes. Extensive experimental results demonstrate that our proposed training strategies effectively enhance the performance of existing ICD coding methods.
研究动机与目标
- 解决自动ICD编码中临床笔记数据有限且多变的挑战。
- 通过自动将临床笔记分割为有意义的部分,利用其半结构化特性。
- 通过对比预训练和掩码部分训练,减少因写作风格和部分排序差异导致的临床笔记变异性。
- 通过结构感知表示学习,在数据稀缺条件下提升现有ICD编码模型的性能。
- 开发一种适用于半结构化数据多标签分类任务的通用框架。
提出的方法
- 提出一种基于内容的算法,自动提取部分标题并分割临床笔记为部分,实现与顺序无关的建模。
- 引入一种基于树编辑距离的软多标签相似性度量的对比预训练框架,用于衡量部分对之间的相似性。
- 设计一种掩码部分训练策略,帮助模型聚焦于与ICD编码预测相关的部分。
- 在损失函数中使用树编辑距离,以更好地捕捉部分之间的语义和结构关系。
- 将所提出的训练策略(对比预训练和掩码部分训练)作为数据增强手段,用于提升现有ICD编码模型。
- 采用JointLAAT、EffectiveCAN和MSMN等主干网络,评估所提训练策略的有效性。
实验结果
研究问题
- RQ1自动部分分割是否能提升在数据稀缺条件下的ICD编码模型鲁棒性?
- RQ2基于树的对比学习结合软多标签相似性在减少临床笔记变异性方面有多有效?
- RQ3掩码部分训练是否通过增强对相关临床部分的关注而提升模型性能?
- RQ4在低数据设置下,所提方法与基线ICD编码模型相比表现如何?
- RQ5所提框架是否可泛化至其他具有半结构化数据的多标签分类任务?
主要发现
- 所提部分分割算法在部分标题提取任务上取得高F1分数,证明其在识别临床笔记结构方面的有效性。
- 基于树编辑距离的对比预训练显著提升ICD编码性能,而替换为Jaccard相似性则导致性能下降,表明语义感知相似性的重要性。
- 掩码部分训练带来的性能提升略高于仅使用对比预训练,表明对预测头的直接优化极为有效。
- 在MIMIC-50任务中,所有评估主干网络(JointLAAT、EffectiveCAN、MSMN)均显示,结合对比预训练与掩码部分训练可达到最佳性能。
- 案例研究显示,采用所提策略的模型能通过关注相关部分(如“体格检查”和“社会史”)成功预测全部四个ICD编码,而基线模型则无法检测出主诊断部分以外的编码。
- 该框架展现出强大的泛化能力,在多个ICD编码模型上均实现一致性能提升,证实其在低数据场景下的通用性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。