Skip to main content
QUICK REVIEW

[논문 리뷰] Learning structures of the French clinical language:development and validation of word embedding models using 21 million clinical reports from electronic health records

Basile Dura, Charline Jean|arXiv (Cornell University)|2022. 07. 26.
Machine Learning in Healthcare인용 수 6
한 줄 요약

이 연구는 APHP의 전자 건강 기록에서 확보한 2,100만 건의 프랑스어 임상 보고서를 기반으로 한 CamemBERT 기반 단어 임베딩 모델 2종을 개발하고 검증한다. 이 모델들은 APMed라는 임상 NLP 작업에서 F1 스코어가 3%p 향상되어 91%에 도달하였으며, 도메인 특화 사전 훈련이 성능 향상에 크게 기여함을 입증하였다. 또한, 초기화 방법에 따른 성능 향상은 없었으며, 사전 훈련된 모델을 재학습하는 것과 초기부터 훈련하는 것 사이에 유의미한 성능 차이가 없음을 확인하였다.

ABSTRACT

Background Clinical studies using real-world data may benefit from exploiting clinical reports, a particularly rich albeit unstructured medium. To that end, natural language processing can extract relevant information. Methods based on transfer learning using pre-trained language models have achieved state-of-the-art results in most NLP applications; however, publicly available models lack exposure to speciality-languages, especially in the medical field. Objective We aimed to evaluate the impact of adapting a language model to French clinical reports on downstream medical NLP tasks. Methods We leveraged a corpus of 21M clinical reports collected from August 2017 to July 2021 at the Greater Paris University Hospitals (APHP) to produce two CamemBERT architectures on speciality language: one retrained from scratch and the other using CamemBERT as its initialisation. We used two French annotated medical datasets to compare our language models to the original CamemBERT network, evaluating the statistical significance of improvement with the Wilcoxon test. Results Our models pretrained on clinical reports increased the average F1-score on APMed (an APHP-specific task) by 3 percentage points to 91%, a statistically significant improvement. They also achieved performance comparable to the original CamemBERT on QUAERO. These results hold true for the fine-tuned and from-scratch versions alike, starting from very few pre-training samples. Conclusions We confirm previous literature showing that adapting generalist pre-train language models such as CamenBERT on speciality corpora improves their performance for downstream clinical NLP tasks. Our results suggest that retraining from scratch does not induce a statistically significant performance gain compared to fine-tuning.

연구 동기 및 목표

  • 사전 훈련이 프랑스어 임상 보고서에 미치는 영향을 후행 임상 NLP 작업에 대해 평가하는 것.
  • 기존 CamemBERT 모델을 임상 데이터에 대해 미세조정하는 것과 임상 데이터에서 처음부터 재학습하는 것을 비교하는 것.
  • 의미 있는 임상 언어 표현을 학습하기 위해 필요한 최소한의 데이터와 훈련 단계를 평가하는 것.
  • 두 개의 프랑스어 의료 NLP 벤치마크인 APMed와 QUAERO에서 모델을 검증하는 것.
  • 특화된 전문 분야 언어로 사전 훈련한 모델이 일반 목적 모델보다 프랑스어 임상 NLP에서 성능 향상에 기여하는지 확인하는 것.

제안 방법

  • 2,100만 건의 프랑스어 임상 보고서를 기반으로 한 두 가지 CamemBERT 기반 모델을 사전 훈련: 하나는 초기부터, 다른 하나는 원본 CamemBERT에서 미세조정.
  • 39개 병원과 1,100만 명의 환자를 포함하는 APHP 임상 데이터 웨어하우스(EDS)의 정제된 코퍼스를 사용.
  • 문서 메타 유형(예: 상담, 영상, 수술 보고서 등)을 균형 있게 유지하고 행정적 노이즈를 줄이기 위해 계층적 샘플링을 적용.
  • 비임상 텍스트 오염(예: 환자 권리 선언 등)을 탐지하고 제거하기 위해 오픈소스 spaCy 기반 파이프라인인 EDS-NLP를 활용.
  • 두 개의 주석이 달린 데이터셋에서 모델을 미세조정: APMed(용량 정보 포함 약물 언급 식별), QUAERO(모든 UMLS 의미 그룹에 걸친 의료 엔티티 식별).
  • F1 스코어를 사용해 성능을 평가하고, 향상 정도의 통계적 유의성을 평가하기 위해 윌코크슨 부호 순위 검정을 적용.

실험 결과

연구 질문

  • RQ1일반 목적 모델과 비교해 프랑스어 임상 보고서에 대해 사전 훈련을 수행하면 후행 의료 NLP 작업에서 성능 향상이 이루어지는가?
  • RQ2임상 데이터에서 기존 CamemBERT 모델을 미세조정하는 것과 초기부터 재학습하는 것 사이에 통계적으로 유의미한 성능 향상이 있는가?
  • RQ3의미 있는 임상 언어 표현을 처음부터 학습하기 위해 필요한 훈련 단계와 데이터 양은 어느 정도인가?
  • RQ4임상 데이터로 사전 훈련한 모델은 다양한 코퍼스에서의 엔티티 식별과 같은 다른 의료 NLP 작업으로 일반화될 수 있는가?
  • RQ5제한된 사전 훈련 데이터에서 시작할 경우, 초기화 방법(초기부터 vs. 미세조정)이 후행 성능에 영향을 미치는가?

주요 결과

  • 임상 보고서로 사전 훈련한 모델은 APMed 작업에서 F1 스코어가 3%p 향상되어 91%에 도달하였으며, 윌코크슨 검정을 통해 통계적 유의성이 확인되었다.
  • APMed에서의 성능 향상은 초기부터 훈련한 모델과 미세조정한 모델 모두에서 일관되게 관찰되었으며, 이는 도메인 특화 사전 훈련이 핵심 요소이며, 초기화 방법은 중요하지 않음을 시사한다.
  • QUAERO 벤치마크에서 원본 CamemBERT와 유사한 성능을 기록하여, 다른 의료 NLP 작업으로의 일반화 능력이 뛰어남을 나타낸다.
  • 초기부터 훈련한 모델과 미세조정한 모델 간에 통계적으로 유의미한 성능 차이가 없었으며, 이는 미세조정이 충분하고 더 효율적임을 시사한다.
  • 결과적으로 전문 임상 코퍼스로 사전 훈련하면 의료 NLP 성능 향상에 크게 기여하며, 제한된 데이터로도 효과적이며, 전체 재학습보다 미세조정이 실용적이고 효율적인 대안임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.