Skip to main content
QUICK REVIEW

[논문 리뷰] Extracting Daily Dosage from Medication Instructions in EHRs: An Automated Approach and Lessons Learned

Diwakar Mahajan, Jennifer J. Liang|arXiv (Cornell University)|2020. 05. 21.
Biomedical Text Mining and Ontologies인용 수 5
한 줄 요약

이 논문은 모든 약물에 대해 자유형식의 EHR 처방문서에서 일일 복용량을 자동으로 추출하는 하이브리드 NLP 시스템을 제시한다. 딥러닝을 통한 엔티티 인식과 규칙 기반 정규화, 정규표현식 매칭을 융합한 방식으로, 전문가가 애너테이션한 1,000건의 샘플 데이터셋에서 재현율 0.95, 정밀도 0.98를 기록하여 EHR 내에서 일일 복용량 계산을 위한 첫 번째 일반 목적의 접근법을 확립한다.

ABSTRACT

Medication timelines have been shown to be effective in helping physicians visualize complex patient medication information. A key feature in many such designs is a longitudinal representation of a medication's daily dosage and its changes over time. However, daily dosage as a discrete value is generally not provided and needs to be derived from free text instructions (Sig). Existing works in daily dosage extraction are narrow in scope, targeting dosage extraction for a single drug from clinical notes. Here, we present an automated approach to calculate daily dosage for all medications, combining deep learning-based named entity extractor with lexicon dictionaries and regular expressions, achieving 0.98 precision and 0.95 recall on an expert-generated dataset of 1,000 Sigs. We also analyze our expert-generated dataset, discuss the challenges in understanding the complex information contained in Sigs, and provide insights to guide future work in the general-purpose daily dosage calculation task.

연구 동기 및 목표

  • 모든 약물에 대해 EHR 약물 지침(Sig 필드)에서 자동으로 일반 목적의 일일 복용량 추출이 이루어지지 않는 문제를 해결하기 위해.
  • 복잡한 다약물 복용 환자에 대한 정확한 장기적 약물 히스토리 시각화를 통해 임상적 인지 부담을 줄이기 위해.
  • 모호함, 일관성 부족, 누락된 제약 조건 등 자유형식 Sig 필드를 해석하는 데 있어 발생하는 과제를 식별하고 분류하기 위해.
  • 신뢰도가 낮을 경우 null을 반환하고 문제 있는 Sigs를 임상의가 검토할 수 있도록 플래그를 설정하는 시스템을 개발하기 위해.
  • Sig 언어 패턴을 분석하고 현재 규칙 기반 정규화 접근법의 한계를 규명하여未래 연구를 이끌기 위해.

제안 방법

  • 딥러닝 기반 명명된 엔티티 식별기(NER)가 Sig 텍스트의 핵심 구성 요소인 복용량, 빈도, 경로를 식별한다.
  • 어휘 기반 정규화 모듈이 자연어 표현(예: '하루 두 번')을 표준화된 복용량 단위와 빈도로 매핑한다.
  • 정규표현식을 사용하여 복용량 표현을 탐지하고 추출하며, '월-수-목-토' 또는 '교차일'과 같은 복잡한 패턴도 포함한다.
  • 개별 복용량을 합산하여 일일 복용량을 계산하고, 저품질 출력을 방지하기 위해 신뢰도 임계값을 적용한다.
  • 해석된 구성 요소를 전문가가 정의한 카테고리와 비교하여 모호하거나 충돌 나거나 불완전한 Sigs를 식별한다.
  • 규칙 기반 파ip라인을 통해 강인성과 해석 가능성을 확보하며, 향후 작업으로는 엔드 투 엔드 시퀀스 투 시퀀스 모델 탐색 계획이 수립되어 있다.

실험 결과

연구 질문

  • RQ1EHR 내 모든 약물에 대해 자유형식 약물 지침에서 일반 목적의 시스템이 정확하게 일일 복용량을 추출할 수 있는가?
  • RQ2복용량 추출 정확도를 저해하는 Sig 필드의 주요 언어적 및 구조적 과제는 무엇인가?
  • RQ3표기 오류, PRN 사용, 최대 제한치 등 Sig 언어의 변형이 자동 복용량 계산의 신뢰성에 어떤 영향을 미치는가?
  • RQ4현재 규칙 기반 시스템에서 가장 흔한 오류 패턴은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ5전문가가 애너테이션한 모호하거나 무효한 Sigs의 카테고리가 시스템의 투명성 향상과 임상적 안전성 향상에 기여할 수 있는가?

주요 결과

  • 시스템은 전문가가 애너테이션한 1,000건의 샘플 데이터셋에서 재현율 0.95, 정밀도 0.98를 기록하여 일일 복용량 추출의 높은 정확도를 입증했다.
  • 가장 흔한 오류 유형은 '신규 표현'으로, '교차일'이나 '월-수-목-토'와 같은 신규 또는 비표준 어휘를 포함한 표현이었다.
  • 최대 일일 제한치나 PRN 예외를 간과한 경우가 상당수 발생하여, 추가 제약 조건이 해석되지 않아 복용량이 과대 평가되는 오류가 발생했다.
  • 대부분의 경우 충돌하는 Sigs를 정확히 식별하고 null을 반환했지만, 두 건의 사례에서는 첫 번째 표현만을 사용하여 잘못된 복용량을 산출하는 데 실패했다.
  • 'talbet'과 같은 철자 오류는 인식되지 않아 현재 정규화 히ュ리스틱의 한계를 드러냈다.
  • 분석 결과, 유사한 경로나 제제 형태를 가진 약물들 사이에 공통된 언어 패턴이 존재하는 것으로 나타나, 약물별 모델링의 기회를 제시했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.