Skip to main content
QUICK REVIEW

[논문 리뷰] Developing a cardiovascular disease risk-factors annotated corpus of Chinese electronic medical records

Jia Su, Bin He|arXiv (Cornell University)|2016. 11. 28.
Biomedical Text Mining and Ontologies참고 문헌 30인용 수 4
한 줄 요약

이 연구는 심혈관질환(CVD) 위험 인자를 시간적 및 진술적 속성과 함께 추출하기 위해 임상의가 참여한 지침을 활용하여 600건의 익명화된 중국 전자의료기록(CEMR)에서 고신뢰도의 위험 인자 애너테이션 코퍼스를 개발하였다. 코퍼스는 상호 애너테이터 간 일致도 F1-스코어 0.968를 기록하여 향후 종단적 임상 데이터에서 CVD 위험 인자 모니터링 및 예측 시스템 개발을 가능하게 하였다.

ABSTRACT

Objective The goal of this study was to build a corpus of cardiovascular disease (CVD) risk-factor annotations based on Chinese electronic medical records (CEMRs). This corpus is intended to be used to develop a risk-factor information extraction system that, in turn, can be applied as a foundation for the further study of the progress of risk-factors and CVD. Materials and Methods We designed a light-annotation-task to capture CVD-risk-factors with indicators, temporal attributes and assertions explicitly displayed in the records. The task included: 1) preparing data; 2) creating guidelines for capturing annotations (these were created with the help of clinicians); 3) proposing annotation method including building the guidelines draft, training the annotators and updating the guidelines, and corpus construction. Results The outcome of this study was a risk-factor-annotated corpus based on de-identified discharge summaries and progress notes from 600 patients. Built with the help of specialists, this corpus has an inter-annotator agreement (IAA) F1-measure of 0.968, indicating a high reliability. Discussion Our annotations included 12 CVD-risk-factors such as Hypertension and Diabetes. The annotations can be applied as a powerful tool to the management of these chronic diseases and the prediction of CVD. Conclusion Guidelines for capturing CVD-risk-factor annotations from CEMRs were proposed and an annotated corpus was established. The obtained document-level annotations can be applied in future studies to monitor risk-factors and CVD over the long term.

연구 동기 및 목표

  • 중국 전자의료기록(CEMR)에서 CVD 위험 인자 추출을 위한 표준화되고 애너테이션 처리된 임상 데이터의 부족을 해결하기 위해.
  • 시간적 속성과 진술 상태(예: 현재, 과거, 없음)를 포함한 CVD 위험 인자를 포괄하는 신뢰할 수 있는 애너테이션 가이드라인을 개발하기 위해.
  • 실제 CEMR에서 유의미한 NLP 응용을 위한 대규모, 익명화된 CVD 위험 인자 애너테이션 코퍼스를 구축하기 위해.
  • 시간에 따라 위험 인자를 정확하게 추적할 수 있도록 가능하게 하여 CVD 진행 경과의 종단적 연구를 지원하기 위해.
  • 임상 텍스트에서 CVD 위험 인자를 추출하고 모니터링하는 자동화된 시스템 개발을 위한 기반을 마련하기 위해.

제안 방법

  • 12개의 사전 정의된 CVD 위험 인자(예: 고혈압, 당뇨병)를 명시적 지표, 시간적 속성, 진술 상태와 함께 추출하는 데 중점을 둔 경량 애너테이션 작업을 설계하였다.
  • 의료진과 협력하여 정의, 예시, 극한 케이스를 포함한 상세한 애너테이션 가이드라인을 제작하였다.
  • 일致성 확보를 위해 지침 초안 작성, 애너테이터 교육, 지침 개선을 반복하는 이터레이티브 애너테이션 프로세스를 구현하였다.
  • 환자의 개인정보 보호와 데이터 익명화를 확보하기 위해 600건의 익명화된 퇴원 기록 및 진행 기록에서 코퍼스를 구축하였다.
  • 애너테이션 신뢰도 평가를 위해 F1-측정치를 사용하여 상호 애너테이터 간 일치도(IHA)를 계산하였다.
  • 최종 코퍼스를 활용하여 임상 텍스트에서 CVD 위험 인자를 추출하는 정보 추출 시스템 개발을 지원하였다.

실험 결과

연구 질문

  • RQ1어떻게 시간적 및 진술적 맥락을 고려하여 중국 전자의료기록에서 CVD 위험 인자를 신뢰성 있게 추출할 수 있는가?
  • RQ2임상 NLP 작업에서 임상의가 참여한 애너테이션 가이드라인을 사용할 경우, 상호 애너테이터 간 일치도는 어느 정도 달성할 수 있는가?
  • RQ3다양한 임상 기록에서 일관된 CVD 위험 인자 추출을 지원하기 위해 표준화된 애너테이션 프레임워크를 개발할 수 있는가?
  • RQ4애너테이션 처리된 코퍼스는 전자 건강기록에서 CVD 위험 인자의 종단적 모니터링에 어느 정도 기여할 수 있는가?
  • RQ5중국어 임상 텍스트에서 CVD 위험 인자를 애너테이션 처리할 때 발생하는 주요 과제는 무엇이며, 이를 구조화된 가이드라인을 통해 어떻게 완화할 수 있는가?

주요 결과

  • 이 연구는 고혈압, 당뇨병 등 12개의 CVD 위험 인자를 포함한 600건의 익명화된 중국 전자의료기록에서 위험 인자 애너테이션 코퍼스를 성공적으로 구축하였다.
  • 코퍼스는 매우 높은 상호 애너테이터 간 일치도(IHA) F1-스코어 0.968를 확보하여 애너테이션의 높은 신뢰도와 일관성을 입증하였다.
  • 의료진이 참여한 애너테이션 가이드라인이 임상 텍스트에서 위험 인자 추출의 정확도와 표준화 수준을 크게 향상시켰다.
  • 시간적 속성과 진술 상태(예: 현재, 과거, 없음)의 포함으로 추출된 정보의 임상적 유용성이 향상되었다.
  • 애너테이션 처리된 코퍼스는 CVD 위험 인자 모니터링에 초점을 맞춘 NLP 시스템의 훈련 및 평가를 위한 견고한 기반을 제공한다.
  • 코퍼스는 시간에 따라 위험 인자의 변화를 추적할 수 있어 CVD 진행 경과의 장기적 연구에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.