Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple Sclerosis Severity Classification From Clinical Text

Alister D Costa, Stefan Denkovski|arXiv (Cornell University)|2020. 10. 29.
Topic Modeling참고 문헌 42인용 수 4
한 줄 요약

이 논문은 70,000건의 익명화된 다발성 경화증(MS) 진료 기록을 기반으로 사전 훈련된 도메인 특화 BERT 모델인 MS-BERT와, 임상 텍스트에서 EDSS 및 기능 하위 점수를 예측하기 위해 MS-BERT를 사용하는 분류기인 MSBC를 소개한다. MSBC는 기존 방법 대비 EDSS 예측의 매크로-F1을 0.12점 향상시켜 0.88에 도달하고, 기능 하위 점수 예측의 매크로-F1을 0.29점 향상시켜 0.63에 도달하여 최신 기술 수준을 확립한다.

ABSTRACT

Multiple Sclerosis (MS) is a chronic, inflammatory and degenerative neurological disease, which is monitored by a specialist using the Expanded Disability Status Scale (EDSS) and recorded in unstructured text in the form of a neurology consult note. An EDSS measurement contains an overall "EDSS" score and several functional subscores. Typically, expert knowledge is required to interpret consult notes and generate these scores. Previous approaches used limited context length Word2Vec embeddings and keyword searches to predict scores given a consult note, but often failed when scores were not explicitly stated. In this work, we present MS-BERT, the first publicly available transformer model trained on real clinical data other than MIMIC. Next, we present MSBC, a classifier that applies MS-BERT to generate embeddings and predict EDSS and functional subscores. Lastly, we explore combining MSBC with other models through the use of Snorkel to generate scores for unlabelled consult notes. MSBC achieves state-of-the-art performance on all metrics and prediction tasks and outperforms the models generated from the Snorkel ensemble. We improve Macro-F1 by 0.12 (to 0.88) for predicting EDSS and on average by 0.29 (to 0.63) for predicting functional subscores over previous Word2Vec CNN and rule-based approaches.

연구 동기 및 목표

  • 기존에 전문가의 해석이 필요로 하는 비정형 신경과 진료 기록에서 다발성 경화증의 중증도를 정확하게 분류하는 데 도전한다.
  • 일반적인 NLP 모델이 MS 전용 임상 텍스트에 적용될 때 겪는 한계—고정된 컨텍스트 길이, 임상 전용 어휘 처리 부족, 익명화 처리로 인한 오류—를 극복한다.
  • 실제 MS 진료 기록을 기반으로 미세조정된 임상적으로 유의미한 공개 가능한 BERT 기반 모델(MS-BERT)을 개발하여 MS 중증도 예측 작업의 성능을 향상시킨다.
  • 전반적인 EDSS 및 기능 시스템 하위 점수를 고정밀도로 예측할 수 있는 강력한 파ip라인(MSBC)을 구축한다.
  • Snorkel 기반 앙상블을 활용해 레이블이 없는 임상 기록을 반감지 학습으로 레이블링하고, 모델의 레이블링 기능으로서의 유용성을 검증한다.

제안 방법

  • 이름을 'Salamanca'로 대체하는 등 의미를 유지하면서 BERT 어휘에 영향을 주지 않는 방식의 보존 전략을 사용해 임상 기록을 익명화한다.
  • BlueBERT에서 출발하여 MS 전용 임상 어휘로 미세조정한 후, 마스크된 언어 모델링을 사용해 70,000건 이상의 익명화된 MS 진료 기록을 기반으로 MS-BERT를 사전 훈련한다.
  • 장기적인 임상 기록의 여러 512토큰 세그먼트에 걸친 서브워드 토큰 임베딩을 집계하여 전체 컨텍스트 정보를 유지하는 방식으로, 환자 기록 수준의 임베딩을 생성하는 방법을 개발한다.
  • MS-BERT 임베딩을 사용해 다중 헤드 분류 헤드를 통해 EDSS 및 기능 하위 점수를 예측하는 분류기인 MSBC를 구축한다.
  • Snorkel 프레임워크를 적용해 MSBC와 다른 레이블링 함수(LF)를 조합하여, 레이블이 없는 데이터에 대해 실버 표준 레이블을 생성하고 반감지 학습을 가능하게 한다.
  • Snorkel에서 조건부 독립성과 레이블 모델 추론을 사용해 LF 정확도를 추정하고 약한 레이블을 생성하며, 골드 표준 애너테이션과의 성능을 검증한다.

실험 결과

연구 질문

  • RQ1실제 MS 임상 기록을 기반으로 훈련된 도메인 특화 BERT 모델이 일반 목적 또는 MIMIC 기반 모델보다 MS 중증도 분류에서 뛰어난 성능을 내는가?
  • RQ2어떻게 하면 컨텍스트 의미를 유지하면서 BERT 토크나이저에 영향을 주지 않는 방식으로 임상 텍스트의 익명화를 수행할 수 있는가?
  • RQ3Transformer의 512토큰 컨텍스트 창 제한으로 인해 장기적인 임상 기록에서 환자 기록 수준의 임베딩을 얼마나 잘 구성할 수 있는가?
  • RQ4Snorkel 기반 앙상블에서 강력한 모델인 MSBC를 레이블링 함수로 사용할 경우, 약한 또는 상관관계가 있는 다른 LF보다 레이블이 없는 데이터에서 성능 향상을 이끌 수 있는가?
  • RQ5앙상블 레이블링을 통해 생성된 실버 표준 레이블로 훈련된 모델의 성능이 골드 표준 레이블로 훈련된 모델의 성능을 따라하거나 뛰어넘을 수 있는가?

주요 결과

  • MSBC는 EDSS 예측에서 매크로-F1 점수 0.88을 기록하여 이전의 Word2Vec CNN 및 규칙 기반 접근 방식보다 0.12점 향상되었다.
  • 기능 하위 점수 예측에서는 MSBC가 매크로-F1 0.63을 기록하여 이전 방법보다 0.29점 향상되었다.
  • Snorkel 앙성으로 생성된 실버 표준 레이블로 훈련된 MSBC-silver 모델은 EDSS 예측 과제에서 모든 이전 베이스라인을 초월했다.
  • MSBC(0.88 F1)에서 MSBC-silver로의 성능 저하가 뿐만 아니라 0.03~0.06에 그쳐, 레이블 생성 과정에서의 강력한 일반화 및 자기 일관성을 시사한다.
  • MSBC는 모든 평가 지표에서 규칙 기반 및 Word2Vec 기반 모델을 앞섰으며, 정성적 오류 분석 결과 EDSS 척도 기준으로 1점 이내의 오차가 거의 없었다.
  • Snorkel의 조건부 독립성 가정이 상관관계가 있는 LF로 인해 위반되었으며, 이는 MSBC를 약한 LF와 함께 조합할 경우 성능 저하를 야기한 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.