Skip to main content
QUICK REVIEW

[论文解读] PLM-ICD: Automatic ICD Coding with Pretrained Language Models

Chao-Wei Huang, Shang-Chi Tsai|arXiv (Cornell University)|Jul 12, 2022
Topic Modeling被引用 4
一句话总结

本文提出PLM-ICD框架,通过解决三个关键挑战——大规模标签空间、长输入序列以及领域不匹配——利用预训练语言模型(PLMs)实现自动ICD编码。通过整合领域特定的预训练、片段池化和标签注意力机制,PLM-ICD在MIMIC-3数据集上实现了最先进性能,微F1达到59.8%,微AUC达到88.65%。

ABSTRACT

Automatically classifying electronic health records (EHRs) into diagnostic codes has been challenging to the NLP community. State-of-the-art methods treated this problem as a multilabel classification problem and proposed various architectures to model this problem. However, these systems did not leverage the superb performance of pretrained language models, which achieved superb performance on natural language understanding tasks. Prior work has shown that pretrained language models underperformed on this task with the regular finetuning scheme. Therefore, this paper aims at analyzing the causes of the underperformance and developing a framework for automatic ICD coding with pretrained language models. We spotted three main issues through the experiments: 1) large label space, 2) long input sequences, and 3) domain mismatch between pretraining and fine-tuning. We propose PLMICD, a framework that tackles the challenges with various strategies. The experimental results show that our proposed framework can overcome the challenges and achieves state-of-the-art performance in terms of multiple metrics on the benchmark MIMIC data. The source code is available at https://github.com/MiuLab/PLM-ICD

研究动机与目标

  • 解决尽管在其他NLP任务中表现优异,但预训练语言模型(PLMs)在自动ICD编码中表现不佳的问题。
  • 识别并解决三大核心挑战:大规模标签空间、超过PLM上下文长度的长输入序列,以及通用领域预训练与临床文本之间的领域不匹配。
  • 开发一个统一框架,整合定制化解决方案,以增强PLM在多标签、长序列、领域特定ICD编码中的有效性。
  • 为在具有类似特征的医疗NLP任务上微调PLM建立最佳实践。
  • 证明当适配得当时,基于PLM的模型可在ICD编码基准上实现竞争力或更优的性能。

提出的方法

  • 使用医学语料库进行领域特定预训练,以减少预训练与微调数据之间的领域不匹配。
  • 实施片段池化以处理长临床记录:将输入划分为重叠片段,使用PLM分别编码每个片段,并聚合表示。
  • 集成标签注意力机制,独立计算PLM隐藏表示与每个ICD标签之间的注意力得分,从而实现有效的多标签分类。
  • 使用子词分词法并配合自定义词汇表(如PubMedBERT、RoBERTa-PM),以减少过度碎片化并提升医学术语的覆盖度。
  • 通过学习率调度和预热优化微调过程,表明对超参数敏感。
  • 评估并比较不同PLM架构和注意力机制,以识别在ICD编码中表现最优的配置。

实验结果

研究问题

  • RQ1为何标准微调方案无法在自动ICD编码中充分发挥PLMs的潜力?
  • RQ2长输入序列和大规模标签集如何影响PLM在临床文本分类中的表现?
  • RQ3通用领域预训练与临床文本之间的领域不匹配在多大程度上影响PLM性能?
  • RQ4哪些架构与训练策略组合能为PLM在ICD编码中实现最优性能?
  • RQ5哪些关键超参数和设计选择显著影响基于PLM的ICD编码模型的最终性能?

主要发现

  • PLM-ICD在MIMIC-3完整测试集上达到微F1 59.8%和微AUC 88.65%,优于先前基于PLM的模型。
  • LAAT中的标签注意力机制表现最佳(宏F1提升10.4%),显著优于CAML(8.7%)和BERT-XML(8.2%)。
  • 片段池化优于HIER-BERT(宏F1提升2.8%)和Longformer(宏F1提升5.1%),证明其在长临床记录中的有效性。
  • 使用最大文档长度3,072个标记和片段长度128个标记,在性能与计算成本之间实现最佳平衡。
  • 学习率和预热调度至关重要:将学习率降低至2e-5会使性能下降约3%,而恒定学习率会使性能下降约4%。
  • 采用领域特定词汇表(如PubMedBERT、RoBERTa-PM)的模型表现更优,且过度碎片化现象减少,优于使用标准词汇表的BERT基模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。