Skip to main content
QUICK REVIEW

[논문 리뷰] Automated clinical coding using off-the-shelf large language models

Joseph S. Boyle, Antanas Kascenas|arXiv (Cornell University)|2023. 10. 10.
Biomedical Text Mining and Ontologies인용 수 4
한 줄 요약

이 논문은 ICD 코드화를 계층적 트리 탐색 작업으로 프레임링하고, LLM이 프롬프트 기반의 관련성 평가를 통해 관련 ICD 코드를 검색함으로써, 사전 학습된 대규모 언어 모델(LLM)을 활용한 제로샷, 희소샷 ICD 코드화 방법을 제안한다. 이는 작업에 특화된 미세조정 없이도 희귀 코드에서 최고 성능인 매크로-F1 0.225를 달성하며, 최소한의 적응으로도 LLM이 자동 임상 코드화에 활용될 수 있음을 보여준다.

ABSTRACT

The task of assigning diagnostic ICD codes to patient hospital admissions is typically performed by expert human coders. Efforts towards automated ICD coding are dominated by supervised deep learning models. However, difficulties in learning to predict the large number of rare codes remain a barrier to adoption in clinical practice. In this work, we leverage off-the-shelf pre-trained generative large language models (LLMs) to develop a practical solution that is suitable for zero-shot and few-shot code assignment, with no need for further task-specific training. Unsupervised pre-training alone does not guarantee precise knowledge of the ICD ontology and specialist clinical coding task, therefore we frame the task as information extraction, providing a description of each coded concept and asking the model to retrieve related mentions. For efficiency, rather than iterating over all codes, we leverage the hierarchical nature of the ICD ontology to sparsely search for relevant codes.

연구 동기 및 목표

  • 작업에 특화된 훈련이나 미세조정이 전혀 필요 없는 제로샷, 희소샷 ICD 코드화 방법을 개발하는 것.
  • ICD-10 온톨로지의 인덕티브 바이어스를 활용하여 자동 코드화에서 희귀 ICD 코드 문제를 해결하는 것.
  • ICD 트리 위에서 희소하고 계층적인 탐색 전략을 사용하여 자원이 적거나 희귀한 ICD 코드에서의 성능을 향상시키는 것.
  • 사전 학습된 LLM이 최소한의 프롬프트 엔지니어링과 재학습 없이도 임상 코드화를 수행할 수 있는지 평가하는 것.
  • 프롬프트 인젝션과 구조화된 탐색을 통해 LLM이 새로운 또는 드문 ICD 코드로 일반화할 수 있음을 보여주는 것.

제안 방법

  • 이 방법은 ICD 코드화를 정보 추출 작업으로 설정하여, LLM이 각 ICD 코드의 텍스트 기술서를 바탕으로 관련성을 평가하도록 프롬프트를 제공한다.
  • 이 방법은 계층적 ICD-10 온톨로지를 따라 탐색하는 트리 탐색 전략을 사용하며, 관련 코드를 포함할 가능성이 낮은 분지들은 잘라내어 성능을 향상시킨다.
  • LLM은 코드의 설명을 포함한 일관된 프롬프트 템플릿을 사용하여 각 노드 수준(예: 장, 블록, 카테고리)에서 관련성을 평가하도록 프롬프트된다.
  • 탐색은 희소하고 동적이다: LLM이 관련성이 있다고 판단한 분지들만 추가로 탐색되며, 이는 계산 비용을 줄이고 전체 코드 목록의 완전한 나열을 피한다.
  • 이 방법은 프롬프트에 ICD 온톨로지의 구조적 지식을 통합하여, LLM의 사전 학습된 코딩 체계 지식 의존도를 줄인다.
  • 성능 평가는 문서 수준 레이블이 스파닝 수준의 애너테이션에서 추출된 CodiEsp 데이터셋을 사용하여 수행된다.

실험 결과

연구 질문

  • RQ1사전 학습된 생성형 LLM이 작업에 특화된 미세조정 없이도 제로샷 ICD 코드화를 수행할 수 있는가?
  • RQ2직접 프롬프트를 사용하는 것과 비교해 계층적 트리 탐색 전략이 희귀 ICD 코드에서 성능 향상에 기여하는가?
  • RQ3ICD 온톨로지 구조 위에서 프롬프트 기반의 관련성 평가가 LLM의 도메인 내 지식이 제한된 점을 상쇄할 수 있는가?
  • RQ4트리 탐색 방법의 성능은 희귀 코드와 일반 코드에서 지도 학습 모델과 비교해 어떻게 다른가?
  • RQ5ICD 온톨로지의 계층적 구조가 LLM을 활용한 효율적이고 정확한 코드 검색을 얼마나 잘 지원하는가?

주요 결과

  • 트리 탐색 방법은 CodiEsp 테스트 세트에서 매크로-F1 0.225를 기록하여 희귀 코드에서 모든 베이스라인을 능가했다.
  • GPT-4는 트리 탐색 전략을 사용하여 마이크로-F1 0.157을 달성했으며, PLM-ICD의 0.216 및 0.219 마이크로-F1 점수보다 略로 낮았지만, 희귀 클래스에서 훨씬 우수한 성능를 보였다.
  • 이 방법은 희귀 ICD 코드에서 최고 성능을 기록하며, 자원이 적거나 미리 보지 못한 코드로의 일반화 능력을 입증했다.
  • ICD 트리의 낮은 수준에서 성능이 저하되었으며, Extension II 수준에서 마이크로-재현율은 0.192로 떨어지고 매크로-재현율은 0.216로 내려가, 깊은 트리 탐색에서의 과제를 보여주었다.
  • 일반적인 프롬프트 템플릿이 모든 모델에 적용되지 않았으며, Llama-2, GPT-3.5, GPT-4에 대해 별도의 프롬프트 엔지니어링이 필요했으며, 이는 Llama-2의 낮은 성능을 설명할 수 있다.
  • 주요 실패 원인은 상호 배타적인 코드(예: B27.89와 B27.80)를 예측하는 것이었으며, 이는 코드 제약 조건에 대한 추론의 한계를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.