Skip to main content
QUICK REVIEW

[논문 리뷰] The Impact of Automatic Pre-annotation in Clinical Note Data Element Extraction - the CLEAN Tool

Tsung-Ting Kuo, Jina Huh|arXiv (Cornell University)|2018. 08. 11.
Biomedical Text Mining and Ontologies참고 문헌 24인용 수 3
한 줄 요약

이 논문은 임상 노트에서 데이터 요소를 추출하는 데 정확성을 향상시키기 위해 사전 주석 기반 임상 노트 주석 시스템인 CLEAN을 소개한다. 통합 파이프라인(CLEAN-EP)과 맞춤형 주석 도구(CLEAN-AT)를 사용하여 CLEAN은 BRAT과 비교해 유의미하게 높은 F1 점수(0.896 대 0.820)를 기록했고, 주석 시간에 유의미한 차이가 없었으며, 효율성을 희생시키지 않은 채 정확성과 사용자 만족도가 향상됨을 입증하였다.

ABSTRACT

Objective. Annotation is expensive but essential for clinical note review and clinical natural language processing (cNLP). However, the extent to which computer-generated pre-annotation is beneficial to human annotation is still an open question. Our study introduces CLEAN (CLinical note rEview and ANnotation), a pre-annotation-based cNLP annotation system to improve clinical note annotation of data elements, and comprehensively compares CLEAN with the widely-used annotation system Brat Rapid Annotation Tool (BRAT). Materials and Methods. CLEAN includes an ensemble pipeline (CLEAN-EP) with a newly developed annotation tool (CLEAN-AT). A domain expert and a novice user/annotator participated in a comparative usability test by tagging 87 data elements related to Congestive Heart Failure (CHF) and Kawasaki Disease (KD) cohorts in 84 public notes. Results. CLEAN achieved higher note-level F1-score (0.896) over BRAT (0.820), with significant difference in correctness (P-value < 0.001), and the mostly related factor being system/software (P-value < 0.001). No significant difference (P-value 0.188) in annotation time was observed between CLEAN (7.262 minutes/note) and BRAT (8.286 minutes/note). The difference was mostly associated with note length (P-value < 0.001) and system/software (P-value 0.013). The expert reported CLEAN to be useful/satisfactory, while the novice reported slight improvements. Discussion. CLEAN improves the correctness of annotation and increases usefulness/satisfaction with the same level of efficiency. Limitations include untested impact of pre-annotation correctness rate, small sample size, small user size, and restrictedly validated gold standard. Conclusion. CLEAN with pre-annotation can be beneficial for an expert to deal with complex annotation tasks involving numerous and diverse target data elements.

연구 동기 및 목표

  • 자동 사전 주석이 임상 노트의 데이터 요소 추출 정확성과 효율성에 미치는 영향을 평가하기 위해.
  • 사전 주석을 통합하여 인간 주석자들을 지원하는 새로운 주석 시스템 CLEAN을 개발하고 테스트하기 위해.
  • 광범위하게 사용되는 BRAT 주석 도구와 비교하여 CLEAN의 성능과 사용성 평가하기 위해.
  • 사전 주석이 주석 정확성과 사용자 만족도를 향상시키며 시간 부담을 증가시키지 않는지 평가하기 위해.
  • 시스템 설계와 사용자 전문성의 주석 결과에 미치는 영향을 조사하기 위해.

제안 방법

  • CLEAN은 여러 NLP 모델을 조합한 통합 파이프라인(CLEAN-EP)을 사용하여 임상 노트의 사전 주석을 생성한다.
  • 맞춤형 주석 도구(CLEAN-AT)는 인간 주석자에게 사전 주석을 제시하여 효율적으로 검토하고 수정할 수 있도록 한다.
  • 84개의 공개 임상 노트(심부전 및 케이드 코hort)를 사용하여 평가하였으며, 총 87개의 데이터 요소를 추출해야 했다.
  • 한 명의 전문가와 한 명의 초보자 주석자를 활용하여 CLEAN과 BRAT을 비교하는 사용성 테스트를 실시하였다.
  • 성능 평가 기준으로는 노트 수준의 F1 점수, 주석 시간, 사용자 보고 만족도를 사용하였다.
  • 통계 분석을 통해 시스템 유형, 노트 길이, 사용자 전문성의 정확성과 시간에 미치는 영향을 평가하였다.

실험 결과

연구 질문

  • RQ1자동 사전 주석이 임상 노트의 데이터 요소 추출에서 인간 주석의 정확성을 향상시키는가?
  • RQ2CLEAN은 주석 시간과 효율성 측면에서 BRAT과 비교해 어떻게 다른가?
  • RQ3사전 주석이 사용자 만족도와 인지된 유용성에 얼마나 기여하는가?
  • RQ4사전 주석의 성능 향상 효과가 사용자 전문성 또는 노트 복잡성에 따라 달라지는가?
  • RQ5시스템 설계, 노트 길이, 사용자 유형 중에서 주석 정확성과 시간에 가장 크게 영향을 주는 요소는 무엇인가?

주요 결과

  • CLEAN은 노트 수준의 F1 점수 0.896을 기록하여 BRAT의 0.820보다 유의미하게 높았으며(p < 0.001), 주석 정확성이 향상됨을 시사한다.
  • 정확성의 차이는 주로 사용된 시스템/소프트웨어에 기인했으며(p < 0.001), 사용자 전문성과는 관련이 없었다.
  • 평균 주석 시간은 CLEAN이 7.262분/노트, BRAT이 8.286분/노트였으며, 유의미한 차이가 없었다(p = 0.188).
  • 노트 길이는 주석 시간에 가장 유의미한 영향을 미쳤다(p < 0.001), 시스템 유형 역시 영향을 주었다(p = 0.013).
  • 전문가 주석자는 CLEAN이 유용하고 만족스럽다고 평가했으며, 초보자 주석자는 사용성에 약간의 향상이 있었다고 보고했다.
  • 결과적으로 사전 주석은 시간 비용을 증가시키지 않으면서도 정확성과 사용성을 향상시키며, 특히 복잡한 주석 작업에 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.