Skip to main content
QUICK REVIEW

[논문 리뷰] TreeMAN: Tree-enhanced Multimodal Attention Network for ICD Coding

Zichen Liu, Xuyuan Liu|arXiv (Cornell University)|2023. 05. 29.
Medical Coding and Health Information인용 수 5
한 줄 요약

TreeMAN은 구조화된 전자 의료 기록(EHR) 데이터와 임상 노트의 텍스트를 학습된 의사결정나무 기반 특징을 통해 융합하는 트리 강화 다중모odal 주의 메커니즘 네트워크를 제안한다. 이는 ICD 코드 예측 정확도를 향상시키기 위해 설계되었다. 주의 메커니즘을 활용해 이러한 나무 기반 특징을 텍스트 표현과 통합함으로써, TreeMAN은 두 개의 MIMIC 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하여 이전의 방법들을 능가한다.

ABSTRACT

ICD coding is designed to assign the disease codes to electronic health records (EHRs) upon discharge, which is crucial for billing and clinical statistics. In an attempt to improve the effectiveness and efficiency of manual coding, many methods have been proposed to automatically predict ICD codes from clinical notes. However, most previous works ignore the decisive information contained in structured medical data in EHRs, which is hard to be captured from the noisy clinical notes. In this paper, we propose a Tree-enhanced Multimodal Attention Network (TreeMAN) to fuse tabular features and textual features into multimodal representations by enhancing the text representations with tree-based features via the attention mechanism. Tree-based features are constructed according to decision trees learned from structured multimodal medical data, which capture the decisive information about ICD coding. We can apply the same multi-label classifier from previous text models to the multimodal representations to predict ICD codes. Experiments on two MIMIC datasets show that our method outperforms prior state-of-the-art ICD coding approaches. The code is available at https://github.com/liu-zichen/TreeMAN.

연구 동기 및 목표

  • 기존의 ICD 코드 예측 모델이 EHR 내 구조화된 의료 데이터를 忽시하는 한계를 해결하기 위해.
  • 통합된 다중모달 표현 프레임워크를 통해 표본 및 텍스트 특징을 융합하여 자동 ICD 코드 예측의 정확성과 견고성을 향상시키기 위해.
  • 수동적인 특징 공학이나 의학 지식에 의존하지 않고, 구조화된 EHR 데이터에서 정보적인 의사결정나무 유도 특징을 자동으로 학습하는 방법을 개발하기 위해.
  • 텍스트와 나무 기반 특징 간의 주의 기반 융합을 통해 다중 레이블 ICD 코드 예측에 적합한 다중모달 신호를 강조하기 위해.
  • 실제 세계의 ICD 코드 예측 벤치마크에서 임상 노트와 구조화된 EHR 데이터를 모두 활용한 다중모달 표현 학습의 효과성을 입증하기 위해.

제안 방법

  • TreeMAN은 혈액 검사 결과, 처방 약물, 생명 징후 등의 구조화된 다중모달 EHR 데이터를 기반으로 의사결정나무를 학습시켜 의사결정나무 기반 특징을 생성한다.
  • 의사결정나무의 출력은 학습된 임bedding 레이어를 통해 벡터 표현으로 변환되어 나무 기반 특징 벡터를 형성한다.
  • 심층 신경망(예: BiLSTM 또는 트랜스포머 기반 인코더)을 사용하여 임상 노트에서 표현을 추출하여 의미적 맥락을 포착한다.
  • 주의 메커니즘이 각 텍스트 표현에 대해 관련 있는 나무 기반 특징을 동적으로 선택함으로써, 다중모달 신호의 적응형 융합을 가능하게 한다.
  • 융합된 다중모달 표현은 표준 다중레이블 분류기로 전달되어 동시에 여러 개의 ICD 코드를 예측한다.
  • 전체 모델은 엔드 투 엔드로 훈련 가능하며, 텍스트 인코딩, 나무 기반 특징 임베딩, 주의 가중치, 다중레이블 분류의 공동 최적화가 가능하다.
Figure 1: An example of automatic multimodal ICD coding. Model inputs include physiological data and medical records in addition to clinical text.
Figure 1: An example of automatic multimodal ICD coding. Model inputs include physiological data and medical records in addition to clinical text.

실험 결과

연구 질문

  • RQ1구조화된 EHR 데이터에서 유도된 의사결정나무 기반 특징이 자동 ICD 코드 예측 모델의 성능을 향상시키는가?
  • RQ2의사결정나무 기반 특징과 임상 노트를 융합하는 데 주의 메커니즘이 얼마나 효과적인가?
  • RQ3의사결정나무에서 파생된 특징 통합은 단순 텍스트에 의존하는 모델보다 더 나은 표현 학습을 이끌어내는가?
  • RQ4기본 벤치마크 ICD 코드 예측 데이터셋에서 TreeMAN은 최신 기술 수준의 방법들과 비교해 어떻게 성능을 내는가?
  • RQ5의사결정나무 기반 특징은 임상 노트에서 모호한 경우가 많은 소형 인슐린 유형 간 미세한 차이를 포착하는 데 얼마나 기여하는가?

주요 결과

  • TreeMAN은 MIMIC-III 및 MIMIC-IV 데이터셋 양쪽에서 이전의 최신 기술 수준 ICD 코드 예측 모델을 능가하며, 다양한 평가 지표에서 뛰어난 성능을 보였다.
  • 나무 기반 특징의 융합은 텍스트 노트가 부족한 희귀 또는 모호한 질환의 경우에 특히 코드 예측 정확도를 크게 향상시켰다.
  • 주의 메커니즘이 각 ICD 코드에 대해 관련 있는 나무 기반 특징을 효과적으로 식별하고 강조함으로써, 설명 가능성과 표현 품질을 향상시켰다.
  • 단순 텍스트 또는 간단한 특징 연결을 사용하는 기준 모델보다 TreeMAN은 F1-macro 및 F1-micro 점수 모두에서 높은 성능을 기록했다.
  • 모델은 정제가 필요한 광범위한 전처리 없이도 EHR에서 유형이 다른 데이터(수치형, 범주형, 시계열)를 처리하는 데 있어 견고성을 보였다.
  • 제거 실험 결과, 랜덤 또는 비학습 기반 특징 공학보다 나무 기반 특징이 성능 향상에 더 큰 기여를 한다는 것이 확인되었으며, 이는 본 방법의 설계 선택의 타당성을 입증한다.
Figure 2: An overview of our proposed multimodal ICD coding framework.
Figure 2: An overview of our proposed multimodal ICD coding framework.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.