Skip to main content
QUICK REVIEW

[논문 리뷰] From Extreme Multi-label to Multi-class: A Hierarchical Approach for Automated ICD-10 Coding Using Phrase-level Attention

Cansu Şen, Bingyang Ye|arXiv (Cornell University)|2021. 02. 18.
Topic Modeling참고 문헌 29인용 수 6
한 줄 요약

이 논문은 먼저 LSTM 기반 문장 태거를 사용해 초점 문장을 식별하고, 그 문장들에 대해 감독형 주의 메커니즘을 적용해 ICD-10 코드를 할당하는 계층적 이단계 접근법을 제안한다. 이 방법은 강력한 기준 모델 대비 23% 높은 서브셋 정확도, 18% 높은 마이크로-F1, 15% 높은 인스턴스 기반 F1을 달성하며, 인간이 애너테이션한 어휘 수준의 지도 정보를 통해 해석 가능성도 향상시킨다.

ABSTRACT

Clinical coding is the task of assigning a set of alphanumeric codes, referred to as ICD (International Classification of Diseases), to a medical event based on the context captured in a clinical narrative. The latest version of ICD, ICD-10, includes more than 70,000 codes. As this is a labor-intensive and error-prone task, automatic ICD coding of medical reports using machine learning has gained significant interest in the last decade. Existing literature has modeled this problem as a multi-label task. Nevertheless, such multi-label approach is challenging due to the extremely large label set size. Furthermore, the interpretability of the predictions is essential for the endusers (e.g., healthcare providers and insurance companies). In this paper, we propose a novel approach for automatic ICD coding by reformulating the extreme multi-label problem into a simpler multi-class problem using a hierarchical solution. We made this approach viable through extensive data collection to acquire phrase-level human coder annotations to supervise our models on learning the specific relations between the input text and predicted ICD codes. Our approach employs two independently trained networks, the sentence tagger and the ICD classifier, stacked hierarchically to predict a codeset for a medical report. The sentence tagger identifies focus sentences containing a medical event or concept relevant to an ICD coding. Using a supervised attention mechanism, the ICD classifier then assigns each focus sentence with an ICD code. The proposed approach outperforms strong baselines by large margins of 23% in subset accuracy, 18% in micro-F1, and 15% in instance based F-1. With our proposed approach, interpretability is achieved not through implicitly learned attention scores but by attributing each prediction to a particular sentence and words selected by human coders.

연구 동기 및 목표

  • 70,000개 이상의 코드를 포함하는 광범위한 레이블 공간과 낮은 모델의 해석 가능성 문제를 포함한 극단적 다중 레이블 ICD-10 코드화의 과제를 해결하기 위해.
  • 작업을 계층적 다중 분류 문제로 재정의하여 과다 코드화를 줄이고 예측 정확도를 향상시키기 위해.
  • 어휘 수준에서 인간 코더의 애너테이션을 직접 주의 메커니즘에 지도하여 해석 가능성을 향상시키기 위해.
  • 각 ICD 코드 예측이 특정 문장과 단어에 기반함을 보장하는 파ip라인을 개발하여 임상적 신뢰도와 투명도를 높이기 위해.
  • 일반적으로 의미적이거나 선택적으로 작동하지 않는 무 supervision 주의 메커니즘의 한계를 완화하기 위해.

제안 방법

  • 이 방법은 이중 단계 파이프라인을 사용한다: ICD 코드화에 관련된 초점 문장을 LSTM 기반 모델을 사용해 식별하는 문장 태거.
  • 문장 태거는 각 문장을 초점 문장 또는 비초점 문장로 분류하기 위해 문장 수준의 지도 정보로 훈련된다.
  • 초점 문장은 ICD 분류기로 전달되며, 이 분류기는 다중 LSTMs와 감독형 주의 메커니즘을 사용해 ICD 코드를 할당한다.
  • 감독형 주의 메커니즘은 인간이 애너테이션한 어휘 수준의 데이터로 훈련되어 주의 점수들이 임상적으로 관련 있는 용어와 일치하도록 보장된다.
  • 최종 코드셋은 초점 문장들에서 예측된 모든 ICD 코드의 합집합으로 생성되며, 각 예측은 특정 문장과 단어로 추적 가능하다.
  • 문장 태거의 감도를 조정함으로써 ICD 분류기에 전달되는 문장 수를 제어하고 과다 예측을 줄일 수 있다.

실험 결과

연구 질문

  • RQ1극단적 다중 레이블 ICD-10 코드화를 계층적 다중 분류 문제로 재정의하면 성능 향상과 과다 코드화 감소에 기여할 수 있는가?
  • RQ2어휘 수준의 인간 애너테이션은 ICD 코드화 모델의 주의 메커니즘의 해석 가능성과 정확도를 향상시킬 수 있는가?
  • RQ3문장 태깅 후 코드 할당을 수행하는 이중 단계 파이프라인은 엔드 투 엔드 다중 레이블 모델 대비 ICD-10 코드화에서 더 우수한 성능을 내는가?
  • RQ4감독형 주의 메커니즘은 비지도 주의 메커니즘에 비해 임상적으로 의미 있는 설명을 얼마나 잘 제공하는가?
  • RQ5여러 유사한 문장이 임상 기록에 존재할 경우 계층적 설계는 모델의 강건성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 파이프라인은 대규모 테스트 세트에서 강력한 기준 모델 대비 23% 높은 서브셋 정확도, 18% 높은 마이크로-F1, 15% 높은 인스턴스 기반 F1을 달성한다.
  • 기준 모델보다 과다 예측 문제를 덜 겪으며, 문장 태거의 민감도를 조정함으로써 이를 추가로 줄일 수 있다.
  • 문장 태거가 초점 문장을 잘못 식별하더라도, 그 문장에 관련된 내용이 포함되어 있으면 ICD 분류기는 여전히 정확한 코드를 할당할 수 있어 성능 유지가 가능하다.
  • 감독형 주의 메커니즘이 임상적으로 관련 있는 단어들—예: 'Melanocytic Nevus'—를 예측의 주요 근거로 성공적으로 식별하여 인간 코더의 판단과 일치시킨다.
  • 기존의 암묵적으로 학습된 주의 점수와 달리, 이 방법은 각 ICD 코드를 특정 문장과 인간 코더가 애너테이션한 단어에 직접 연결함으로써 뛰어난 해석 가능성을 달성한다.
  • 여러 유사한 문장이 존재하는 경우에도 모델이 강건하게 작동한다. 최종 코드셋은 합집합으로 구성되므로, 문장 태거의 정확도가 다소 떨어져도 정확한 예측이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.