Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Zero-shot ICD Coding

Congzheng Song, Shanghang Zhang|arXiv (Cornell University)|2019. 09. 28.
Music and Audio Processing참고 문헌 20인용 수 6
한 줄 요약

이 논문은 코드 설명과 계층적 구조를 사용하여 제로샷 ICD 코드를 위한 잠재 특징을 합성하고, 입력 텍스트로부터 관련 关键词을 재구성하여 의미 일관성을 확보하는 적대적 생성 모델인 AGMC-HTS를 제안한다. MIMIC-III 데이터셋에서 제로샷 ICD 코드에 대해 20.91%의 F1 스코어를 달성하였으며, 최신 기술 대비 절대 AUC 향상 3%를 기록하였다.

ABSTRACT

The International Classification of Diseases (ICD) is a list of classification codes for the diagnoses. Automatic ICD coding is in high demand as the manual coding can be labor-intensive and error-prone. It is a multi-label text classification task with extremely long-tailed label distribution, making it difficult to perform fine-grained classification on both frequent and zero-shot codes at the same time. In this paper, we propose a latent feature generation framework for generalized zero-shot ICD coding, where we aim to improve the prediction on codes that have no labeled data without compromising the performance on seen codes. Our framework generates pseudo features conditioned on the ICD code descriptions and exploits the ICD code hierarchical structure. To guarantee the semantic consistency between the generated features and real features, we reconstruct the keywords in the input documents that are related to the conditioned ICD codes. To the best of our knowledge, this works represents the first one that proposes an adversarial generative model for the generalized zero-shot learning on multi-label text classification. Extensive experiments demonstrate the effectiveness of our approach. On the public MIMIC-III dataset, our methods improve the F1 score from nearly 0 to 20.91% for the zero-shot codes, and increase the AUC score by 3% (absolute improvement) from previous state of the art. We also show that the framework improves the performance on few-shot codes.

연구 동기 및 목표

  • 많은 ICD 코드에 대해 레이블이 없는 훈련 예제가 존재하는 다중 레이블 임상 텍스트 분류에서 광범위한 제로샷 학습 문제에 대응한다.
  • ICD 코드 빈도의 장꼬리 분포로 인해 본래의 학습된 코드 성능이 저하되지 않도록 제로샷 ICD 코드에서의 분류 성능을 향상시킨다.
  • ICD 코드의 계층적 구조를 활용하여 특징 생성을 이끌고 합성 특징의 의미적 관련성을 향상시킨다.
  • 입력 문서에서 조건부 ICD 코드와 관련된 关键词을 재구성하여 실제와 합성 특징 간의 의미 일관성을 확보한다.
  • 단지 제로샷 시나리오를 넘어서, 제한된 레이블 데이터를 가진 소수의 샘플에 대해서도 성능을 향상시킬 수 있도록 프레임워크를 확장한다.

제안 방법

  • 제안된 조건부 생성 적대적 네트워크(GAN)인 AGMC-HTS는 코드의 텍스트 기반 설명에 기반해 ICD 코드의 잠재 특징을 생성한다.
  • ICD 코드의 계층적 구조를 통합하여, 제로샷 코드가 트리 구조상 가장 가까운 형제 코드의 특징과 유사하게 특징을 생성하도록 유도한다.
  • 가짜 사이클 생성 아키텍처를 구현하여, 조건부 ICD 코드와 관련된 입력 문서의 关键词을 재구성함으로써 실제 특징과 합성 특징 간의 의미 일치를 확보한다.
  • 훈련 안정성과 특징 품질 향상을 위해 새로운 $\gamma$-가중 경사 페널티($\mathcal{L}_{\texttt{WGAN-Z}}$)를 포함한 수정된 WGAN-GP 손실을 생성기 및 판별기에서 사용한다.
  • 생성된 특징을 사용해 ICD 코드 분류기를 미세 조정함으로써, 미사용 코드로의 일반화 능력을 향상시킨다.
  • 생성된 특징에서 관련 关键词을 재구성하는 데 목적이 있는 关键词 재구성 손실($\mathcal{L}_{\texttt{KEY}}$)을 도입하여 의미 충실도를 유지한다.

실험 결과

연구 질문

  • RQ1생성 모델이 본래의 학습된 코드 정확도를 유지하면서도 제로샷 ICD 코드 분류 성능을 효과적으로 향상시킬 수 있는가?
  • RQ2ICD 코드의 계층적 구조를 통합할 경우, 미사용 코드에 대한 특징 생성 품질과 의미적 관련성은 어떻게 향상되는가?
  • RQ3생성된 특징에서의 关键词 재구성은 실제 임상 텍스트와의 의미 일관성을 어느 정도 유지하는가?
  • RQ4제안된 프레임워크는 제한된 레이블 예제가 있는 소수의 샘플 코드로도 일반화 가능한가?
  • RQ5계층적 제약과 关键词 재구성 조건을 통합한 제안된 적대적 훈련 방식은 기존의 GAN 기반 또는 비생성적 접근 방식과 비교해 다중 레이블 ICD 코드 분류에서 어떤가?
  • RQ6key_findings

주요 결과

  • 제안된 방법은 제로샷 ICD 코드에서 20.91%의 F1 스코어를 달성하였으며, 이는 이전 방법에서 거의 0%였던 것과 대비된다.
  • 프레임워크는 MIMIC-III 데이터셋에서 이전 최신 기술 대비 AUC 스코어를 3%포인트(절대 향상) 높였다.
  • 특징 재구성 손실($\mathcal{L}_{\texttt{KEY}}$)과 함께 $\gamma$-가중 WGAN 손실($\mathcal{L}_{\texttt{WGAN-Z}}$)을 사용할 경우, 소수의 샘플 코드에서 20.15%의 F1 스코어를 기록하여 최고의 성능을 달성하였다.
  • 모델은 소수의 샘플 코드에 대해 재현율과 F1 스코어를 향상시켜, 제한된 훈련 데이터 조건에서도 효과적임을 입증하였다.
  • 정성적 분석을 통해 제로샷 코드에서 생성된 특징는 의미적으로 관련된 关键词(예: 코드 V10.62에 대해 'leukemia', 'CML')를 재구성할 수 있음을 확인하였으며, 이는 클래스 의미가 유지됨을 시사한다.
  • 계층적 인덕티브 바이어스와 关键词 재구성 메커니즘은 기존의 GAN 기반 기준 모델 대비 합성 특징의 품질과 관련성을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.