Skip to main content
QUICK REVIEW

[论文解读] Automated clinical coding using off-the-shelf large language models

Joseph S. Boyle, Antanas Kascenas|arXiv (Cornell University)|Oct 10, 2023
Biomedical Text Mining and Ontologies被引用 4
一句话总结

本文提出了一种零样本、少样本的ICD编码方法,通过将编码任务建模为分层树搜索,利用现成的大规模语言模型(LLMs)实现。LLMs通过基于提示的相关性评估检索相关ICD编码。该方法在无需任何任务特定微调的情况下,在罕见编码上实现了0.225的宏F1,达到当前最先进水平,证明了LLMs在极少适配下实现自动化临床编码的可行性。

ABSTRACT

The task of assigning diagnostic ICD codes to patient hospital admissions is typically performed by expert human coders. Efforts towards automated ICD coding are dominated by supervised deep learning models. However, difficulties in learning to predict the large number of rare codes remain a barrier to adoption in clinical practice. In this work, we leverage off-the-shelf pre-trained generative large language models (LLMs) to develop a practical solution that is suitable for zero-shot and few-shot code assignment, with no need for further task-specific training. Unsupervised pre-training alone does not guarantee precise knowledge of the ICD ontology and specialist clinical coding task, therefore we frame the task as information extraction, providing a description of each coded concept and asking the model to retrieve related mentions. For efficiency, rather than iterating over all codes, we leverage the hierarchical nature of the ICD ontology to sparsely search for relevant codes.

研究动机与目标

  • 开发一种无需任务特定训练或微调的零样本、少样本ICD编码方法。
  • 通过利用ICD-10本体的归纳偏置,解决自动化编码中罕见ICD编码的挑战。
  • 通过在ICD树上采用稀疏、分层的搜索策略,提升低资源和罕见ICD编码的性能。
  • 评估现成LLMs是否能在极少提示工程和无需微调的情况下执行临床编码。
  • 证明LLMs可通过提示注入和结构化搜索,泛化到未见过或极少见的ICD编码。

提出的方法

  • 该方法将ICD编码建模为信息抽取任务,通过提示让LLM基于其文本描述评估每个ICD编码的相关性。
  • 采用树搜索策略,遍历分层的ICD-10本体,剪枝那些不太可能包含相关编码的分支。
  • LLM在每个节点层级(如章节、块、类别)使用一致的提示模板评估相关性,结合编码的描述。
  • 搜索过程稀疏且动态:仅对LLM判断为相关的分支进行进一步探索,从而降低计算成本并避免穷举所有编码。
  • 在提示中注入ICD本体的结构化知识,减少对LLM预训练知识中编码系统理解的依赖。
  • 性能通过CodiEsp数据集进行评估,文档级标签由跨度级标注抽象得出。

实验结果

研究问题

  • RQ1现成的生成式LLMs是否能在无需任何任务特定微调的情况下执行零样本ICD编码?
  • RQ2与直接提示相比,分层树搜索策略是否能提升罕见ICD编码的性能?
  • RQ3基于ICD本体结构的提示相关性评估,是否能弥补LLMs在领域内知识有限的缺陷?
  • RQ4树搜索方法在罕见与常见ICD编码上的性能,与监督模型相比如何?
  • RQ5ICD本体的分层结构在多大程度上能实现LLMs高效且准确的编码检索?

主要发现

  • 树搜索方法在CodiEsp测试集上实现了0.225的宏F1,优于所有基线模型在罕见编码上的表现。
  • GPT-4结合树搜索策略实现了0.157的微F1,略低于PLM-ICD的0.216和0.219微F1,但在罕见类别上表现显著更优。
  • 该方法在罕见ICD编码上实现了最先进性能,凸显其在低资源或未见编码上的泛化能力。
  • 在ICD树的较低层级性能下降,微召回率在扩展II级降至0.192,宏召回率降至0.216,表明深层树遍历存在挑战。
  • 通用提示模板无法适用于所有模型,需为Llama-2、GPT-3.5和GPT-4分别进行提示工程,这可能是Llama-2性能较低的原因。
  • 一个关键失败模式是预测互斥编码(如B27.89和B27.80),表明LLMs在理解编码约束方面存在推理局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。