Skip to main content
QUICK REVIEW

[논문 리뷰] Mimic-IV-ICD: A new benchmark for eXtreme MultiLabel Classification

Thanh-Tung Nguyen, Viktor Schlegel|arXiv (Cornell University)|2023. 04. 27.
Machine Learning in Healthcare인용 수 4
한 줄 요약

이 논문은 MIMIC-IV 전자 의료 기록 데이터셋을 사용하여 극단적 다중 레이블 ICD 코드 부여를 위한 새로운 오픈 벤치마크인 Mimic-IV-ICD를 소개한다. 이는 ICD-9 및 ICD-10 코드를 모두 지원하며, 데이터 전처리를 표준화하고, 다양한 딥러닝 모델을 평가하며 재현 가능한 베이스라인을 수립한다. 특히, 코드 설명어의 통합이 뛰어나, 저빈도 코드 그룹에서 PLM-ICD보다 MSMN이 뛰어난 성능을 보였다.

ABSTRACT

Clinical notes are assigned ICD codes - sets of codes for diagnoses and procedures. In the recent years, predictive machine learning models have been built for automatic ICD coding. However, there is a lack of widely accepted benchmarks for automated ICD coding models based on large-scale public EHR data. This paper proposes a public benchmark suite for ICD-10 coding using a large EHR dataset derived from MIMIC-IV, the most recent public EHR dataset. We implement and compare several popular methods for ICD coding prediction tasks to standardize data preprocessing and establish a comprehensive ICD coding benchmark dataset. This approach fosters reproducibility and model comparison, accelerating progress toward employing automated ICD coding in future studies. Furthermore, we create a new ICD-9 benchmark using MIMIC-IV data, providing more data points and a higher number of ICD codes than MIMIC-III. Our open-source code offers easy access to data processing steps, benchmark creation, and experiment replication for those with MIMIC-IV access, providing insights, guidance, and protocols to efficiently develop ICD coding models.

연구 동기 및 목표

  • 대규모 공공 EHR 데이터를 활용한 자동 ICD 코드 부여를 위한 널리 수용된 벤치마크의 부족을 해결하기 위해.
  • MIMIC-IV에서 ICD 코드 부여 작업을 위한 데이터 전처리 및 모델 평가 파이프라인을 표준화하기 위해.
  • 이전의 벤치마크보다 더 많은 코드 수와 데이터 포인트를 포함하여 ICD-9 및 ICD-10 코드 부여를 위한 종합적인 벤치마크를 수립하기 위해.
  • 데이터 처리 및 실험 재현을 위한 오픈소스 코드를 공개하여 재현 가능성을 보장하고 모델 비교를 용이하게 하기 위해.
  • 미래 연구를 위한 표준화되고 공개 가능한 벤치마크를 제공함으로써 자동 ICD 코드 부여 연구를 가속화하기 위해.

제안 방법

  • 저자들은 원시 MIMIC-IV 임상 노트를 표준화된 절차를 통해 처리하고, ICD-9 및 ICD-10 코드로 매핑한다.
  • PLM-ICD 및 MSMN과 같은 다양한 딥러닝 모델을 구현하고 ICD 코드 예측을 위한 비교 평가를 수행한다.
  • 벤치마크는 전체 코드 설정과 고빈도 코드 설정을 포함하며, 코드 빈도 그룹을 활용해 레이블 빈도 분포에 따른 모델 성능을 평가한다.
  • 특히 MSMN 모델에서 코드 설명어 및 동의어를 통합하여 임상 노트와 ICD 코드 간의 의미적 일치도를 향상시킨다.
  • MIMIC-IV 접근 권한을 가진 연구자들이 데이터 처리, 벤치마크 생성 및 실험 재현을 위해 사용할 수 있도록 공개된 오픈소스 코드베이스를 제공한다.
  • 파이프라인은 ICD-9 및 ICD-10 코드 부여를 모두 지원하며, ICD-10 벤치마크는 155,000개 이상의 코드를 포함하여 MIMIC-III에 비해 크게 확장되었다.

실험 결과

연구 질문

  • RQ1MIMIC-IV 데이터를 활용한 극단적 다중 레이블 ICD 코드 부여 작업에서 다양한 딥러닝 모델의 성능은 어떻게 되는가?
  • RQ2코드 설명어 및 동의어를 통합할 경우, 특히 희귀 ICD 코드에 대해 모델 성능에 어떤 영향을 미치는가?
  • RQ3ICD-10 코드 부여 작업에서 코드 빈도 그룹(예: 1–10, 11–50, 51–100, >500)에 따라 모델 성능은 어떻게 달라지는가?
  • RQ4표준화되고 오픈된 벤치마크는 자동 ICD 코드 부여 연구의 재현 가능성 향상과 연구 진전 가속화에 기여할 수 있는가?
  • RQ5기존의 MIMIC-III 벤치마크와 비교해, 새로운 MIMIC-IV-ICD 벤치마크는 데이터 양과 코드 커버리지 측면에서 어떤가?

주요 결과

  • MSMN은 코드 빈도 그룹 1–10, 11–50, 51–100에서 PLM-ICD를 능가하며, 특히 매크로 F1 스코어에서 뛰어난 성능을 보였다. 이는 코드 설명어 및 동의어의 우수한 통합 덕분이었다.
  • PLM-ICD는 >500 코드 그룹에서 MSMN보다 뛰어난 성능을 보였으며, 이는 대규모 사전 학습된 언어 모델이 고빈도 레이블에서 뛰어난 성능을 발휘함을 시사한다.
  • >500 및 101–500 그룹에서 MSMN과 PLM-ICD 간 매크로 F1 차이는 1%였으며, MSMN은 저빈도 카테고리에서 더 강력한 성능을 보였다.
  • 벤치마크는 155,000개 이상의 ICD-10 코드와 MIMIC-III보다 더 많은 데이터 포인트를 포함하여 공개된 ICD 코드 부여 데이터의 규모를 크게 확장했다.
  • 오픈소스 코드베이스를 통해 데이터 전처리 및 모델 학습의 전 과정을 완전히 재현할 수 있어, 향후 개선 및 모델 비교를 지원한다.
  • 결과는 대규모 언어 모델과 구조화된 코드 메타데이터(예: 설명어, 동의어)를 조합하면 희귀 ICD 코드에 대한 성능 향상에 기여할 수 있음을 시사하며, 이는 미래 연구의 유망한 방향성을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.