Skip to main content
QUICK REVIEW

[논문 리뷰] Negation detection in Dutch clinical texts: an evaluation of rule-based and machine learning methods

Bram van Es, Leon C. Reteig|arXiv (Cornell University)|2022. 09. 01.
Topic Modeling인용 수 4
한 줄 요약

이 연구는 에라스무스 의료 센터 네덜란드 임상 코퍼스를 사용하여 네덜란드 임상 노트에서 부정 탐지에 대한 규칙 기반 및 기계 학습 접근법을 평가한다. biLSTM 및 RoBERTa 기반 모델은 맥락 기반 규칙 기반 방법(ContextD)을 크게 능가하며, 영역 간에 F1 점수가 0.95 이상을 기록한다. 이는 딥 러닝 모델이 더 높은 계산 비용에도 불구하고 네덜란드어 임상 부정 탐지에 더 효과적이라는 것을 보여준다.

ABSTRACT

As structured data are often insufficient, labels need to be extracted from free text in electronic health records when developing models for clinical information retrieval and decision support systems. One of the most important contextual properties in clinical text is negation, which indicates the absence of findings. We aimed to improve large scale extraction of labels by comparing three methods for negation detection in Dutch clinical notes. We used the Erasmus Medical Center Dutch Clinical Corpus to compare a rule-based method based on ContextD, a biLSTM model using MedCAT and (finetuned) RoBERTa-based models. We found that both the biLSTM and RoBERTa models consistently outperform the rule-based model in terms of F1 score, precision and recall. In addition, we systematically categorized the classification errors for each model, which can be used to further improve model performance in particular applications. Combining the three models naively was not beneficial in terms of performance. We conclude that the biLSTM and RoBERTa-based models in particular are highly accurate accurate in detecting clinical negations, but that ultimately all three approaches can be viable depending on the use case at hand.

연구 동기 및 목표

  • 자유 텍스트 네덜란드 전자 건강 기록(EHR)에서 대규모 레이블 추출을 향상시키기 위해 다양한 부정 탐지 방법을 평가하는 것.
  • 구조화된 EHR 데이터가 임상 의사결정 지원 시스템에 대해 정밀도와 신뢰성 측면에서 떨어지는 문제를 해결하는 것.
  • 규칙 기반 방법(ContextD)과 두 가지 기계 학습 접근법(양방향 LSTM 모델(MedCAT) 및 RoBERTa 기반 모델(RobBERT))의 성능을 비교하는 것.
  • 분류 오류를 체계적으로 분류하여 향후 모델 개선을 안내하는 것.
  • 세 모델을 단순 앙상블하여 성능 향상을 달성할 수 있는지 평가하는 것.

제안 방법

  • 부정 탐지 방법 평가의 기준 데이터셋으로 에라스무스 의료 센터 네덜란드 임상 코퍼스를 사용하였다.
  • 부정 트리거를 위한 400개 이상의 사전 정의된 정규 표현식 패턴을 적용하는 ContextD를 사용한 규칙 기반 접근법을 구현하였다.
  • 의료 용어의 맥락에서 부정 여부를 분류하기 위해 MedCAT를 사용해 양방향 장기 단기 기억망(biLSTM) 모델을 훈련시켰다.
  • 네덜란드 임상 텍스트에서 시퀀스 분류를 위해 RoBERTa 기반 모델(RobBERT)과 그 도메인 적응형 버전(MedRoBERTa.nl)을 토벌하여 미세조정하였다.
  • 퇴원 서면, 일반의사 기록, 방사선 보고서, 전문의 서신의 네 가지 EHR 텍스트 유형에서 모델을 평가하였다.
  • 시퀀스 길이(32 vs. 512 토큰)와 미세조정 전략이 모델 성능에 미치는 영향을 평가하기 위해 분석 실험을 실시하였다.

실험 결과

연구 질문

  • RQ1규칙 기반 및 기계 학습 기반 부정 탐지 방법이 네덜란드 임상 노트에서 F1 점수, 정밀도 및 재현율 측면에서 어떻게 비교되는가?
  • RQ2일반 도메인 RoBERTa 대비 도메인 특화 사전 훈련(MedRoBERTa.nl)이 부정 탐지 성능 향상에 얼마나 기여하는가?
  • RQ3최대 시퀀스 길이를 512 토큰에서 32 토큰으로 줄이는 것이 계산 비용을 줄이면서 성능에 심각한 영향을 미치는가?
  • RQ4세 모델(규칙 기반, biLSTM, RoBERTa)을 단순 앙상블 방식으로 조합하면 전체 성능 향상이 이루어지는가?
  • RQ5각 모델에서 가장 흔한 오류 패턴은 무엇이며, 이를 향후 모델 정교화에 어떻게 활용할 수 있는가?

주요 결과

  • biLSTM 및 RoBERTa 기반 모델은 일관되게 규칙 기반 ContextD 방법을 능가하여 모든 텍스트 유형에서 F1 점수가 0.95 이상을 기록하였다.
  • RoBERTa 기반 모델(MedRoBERTa.nl)은 퇴원 서면에서 F1 점수 0.974, 방사선 보고서에서 0.957, 전문의 서신에서 0.925를 기록하였다.
  • 최대 시퀀스 길이를 512 토큰에서 32 토큰으로 줄이는 것은 성능에 거의 영향을 주지 않았으며, 대부분의 경우 F1 점수가 0.01 이내로 감소하였다.
  • 도메인 적응형 사전 훈련(MedRoBERTa.nl)은 일반 도메인 RobBERT 모델 대비 약간이지만 일관된 성능 향상을 이끌었다.
  • RoBERTa 모델 전체를 미세조정하는 것이 마지막 밀도층만 미세조정하는 것보다 유의미하게 더 좋은 결과를 얻었으며, 후자는 규칙 기반 방법과 유사한 성능을 보였다.
  • 모든 세 모델을 단순 앙상블하는 방법은 성능 향상을 이끌지 못했으며, 개별 RoBERTa 및 biLSTM 모델에 비해 뒤처졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.