Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Label Classification of Patient Notes a Case Study on ICD Code Assignment

Tal Baumel, Jumana Nassour-Kassis|arXiv (Cornell University)|2017. 09. 27.
Biomedical Text Mining and Ontologies인용 수 88
한 줄 요약

이 논문은 discharge 요약에서 여러 ICD 코드를 할당하기 위한 네 가지 모델을 비교하고, 오류 분석을 위한 투명한 문장 수준 주의를 가지는 상태-오브-더-아트(SOTA) 결과를 달성하는 계층적 주의 GRU(HA-GRU)를 보여줍니다. 완전한 ICD-9 코드와 롤업된 코드를 사용한 MIMIC II/III 데이터셟을 활용합니다.

ABSTRACT

In the context of the Electronic Health Record, automated diagnosis coding of patient notes is a useful task, but a challenging one due to the large number of codes and the length of patient notes. We investigate four models for assigning multiple ICD codes to discharge summaries taken from both MIMIC II and III. We present Hierarchical Attention-GRU (HA-GRU), a hierarchical approach to tag a document by identifying the sentences relevant for each label. HA-GRU achieves state-of-the art results. Furthermore, the learned sentence-level attention layer highlights the model decision process, allows easier error analysis, and suggests future directions for improvement.

연구 동기 및 목표

  • 장기 임상 노트에서 매우 큰 라벨 집합을 갖는 자동 다중 라벨 ICD 코딩의 동기를 제시한다.
  • 네 가지 모델(SVM, CBOW, CNN, HA-GRU)을 전체 ICD-9 코드 세트와 롤업된 코드 세트에서 조사한다.
  • Prediction을 설명하기 위한 주의 메커니즘을 통해 모델의 투명성을 제공한다.
  • MIMIC II 및 MIMIC III에서 학습 데이터 크기 효과와 일반화 가능성을 평가한다.

제안 방법

  • 다중 라벨 ICD 코딩을 위한 네 가지 모델 평가: one-vs-all SVM, CBOW 신경망 모델, CNN, 그리고 계층형 문장 수준 주의를 갖춘 HA-GRU.
  • 텍스트를 spaCy 토큰화, 편집 거리 기반 정규화, 5+ 토큰 어휘 컷오프를 사용해 전처리한다.
  • 문서를 계층적으로 문장으로 구분해 두 수준 GRU 인코더를 가능하게 한다.
  • HA-GRU는 문장 수준 양방향 GRU와 주의를 적용해 각 라벨별로 관련 문장을 선택한 다음, 라벨별 주의가 있는 문서 수준 양방향 GRU를 수행한다.
  • 각 분류기를 SVM/CBOW/CNN의 이진 크로스 엔트로피와 HA-GRU의 범주형 크로스 엔트로피로 각각 학습하고, 각 라벨에 대해 소프트맥스 출력을 사용한다.
  • 두 가지 라벨 구성을 비교한다: 전체 5자리 ICD-9 코드와 롤업된 3자리 코드.

실험 결과

연구 질문

  • RQ1매우 큰 ICD 코드 집합으로 긴 discharge 요약에서 극도 다중 라벨 분류를 효과적으로 수행할 수 있는가?
  • RQ2DRNN(HA-GRU)의 계층적 주의가 전통적 baselines에 비해 다중 라벨 ICD 코드 할당을 개선하는가?
  • RQ3전체 ICD-9 대 ICD-9 코드 세트와 롤업된 코드 세트 및 서로 다른 학습 데이터 크기(MIMIC II 대 MIMIC III)에서 모델은 어떻게 수행하는가?
  • RQ4주의 메커니즘이 ICD 코드 예측에 대해 투명하고 해석 가능한 설명을 제공할 수 있는가?

주요 결과

  • HA-GRU는 롤업된 ICD-9 코드에 대해 최고의 성능을 보이며, MIMIC III에서 Micro-F1 55.86%를 달성하고, 비-HA 베이스라인 중 최상위보다 약 2.8 퍼센트 포인트 앞섰다.
  • 전체 ICD-9 실험에서 CNN이 MIMIC III에서 HA-GRU보다 약간 더 우수한 경우가 있지만, HA-GRU는 여전히 강하고 설명 능력이 더 좋다.
  • MIMIC II 대 MIMIC III에서 학습 데이터가 늘어나면 모든 모델의 성능이 향상되고, 롤업된 작업에서 HA-GRU가 상당한 이득을 보인다(예: 롤업 설정의 MIMIC II에서 F1 점수가 절대적으로 7% 개선).
  • 두 수준의 주의를 통해 라벨별 문장 선택과 문장별 단어 수준 초점을 가능하게 하여 모델 투명성과 오류 분석을 돕는다.
  • rare variant를 편집 거리로 토큰화하고 정규화하는 전처리 단계가 CBOW와 CNN의 성능을 약 0.5% F1만큼 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.