Skip to main content
QUICK REVIEW

[논문 리뷰] Extraction and Analysis of Clinically Important Follow-up Recommendations in a Large Radiology Dataset

Wilson Lau, Thomas H. Payne|arXiv (Cornell University)|2019. 05. 14.
Topic Modeling참고 문헌 22인용 수 11
한 줄 요약

이 논문은 영상의학 보고서에서 임상적으로 중요한 추적 검사 권고사항—이유, 검사 유형, 시간 프레임—을 자동으로 추출하기 위한 딥러닝 기반 자연어 처리(NLP) 접근법을 제시한다. 567건의 보고서로 구성된 주석 처리된 코퍼스를 기반으로 훈련된 모델은 추천 문장에 대해 F-점수 0.92, 시간 프레임에 대해 0.84, 검사에 대해 0.73, 이유에 대해 0.65를 기록했으며, 이는 330만 건이 넘는 보고서에 적용되어 추적 검사 이행도를 분석하는 데 사용되었다.

ABSTRACT

Communication of follow-up recommendations when abnormalities are identified on imaging studies is prone to error. In this paper, we present a natural language processing approach based on deep learning to automatically identify clinically important recommendations in radiology reports. Our approach first identifies the recommendation sentences and then extracts reason, test, and time frame of the identified recommendations. To train our extraction models, we created a corpus of 567 radiology reports annotated for recommendation information. Our extraction models achieved 0.92 f-score for recommendation sentence, 0.65 f-score for reason, 0.73 f-score for test, and 0.84 f-score for time frame. We applied the extraction models to a set of over 3.3 million radiology reports and analyzed the adherence of follow-up recommendations.

연구 동기 및 목표

  • 영상의학 소견 이후 추적 검사 권고사항 전달 과정에서 발생할 수 있는 오류의 위험을 해결하기 위해.
  • 영상의학 보고서 내 추적 검사 권고사항의 핵심 구성 요소를 자동으로 식별하고 추출하는 방법을 개발하기 위해.
  • NLP 모델 훈련 및 평가를 위해 사용할 수 있는 고품질의 전문가 주석 처리 코퍼스 567건을 구축하기 위해.
  • 330만 건이 넘는 영상의학 보고서를 대상으로 추적 검사 이행도를 대규모로 분석하기 위해.

제안 방법

  • 두 단계로 구성된 딥러닝 파이프라인: 먼저 추천 문장을 식별하고, 그 다음 구조화된 구성 요소(이유, 검사 유형, 시간 프레임)를 추출한다.
  • BERT 기반 아키텍처를 포함한 시퀀스 레이블링 모델을 활용하여 추천 요소를 동시에 추출한다.
  • 전문가가 주석 처리한 567건의 영상의학 보고서로 구성된 골드스탠다드 데이터셋을 구축한다.
  • 여러 추출 작업에 걸쳐 F-점수를 주요 평가 지표로 사용하여 모델 훈련 및 평가를 수행한다.
  • 실제 330만 건의 영상의학 보고서로 구성된 데이터셋에 훈련된 모델을 적용하여 임상적 이행 패턴을 평가한다.

실험 결과

연구 질문

  • RQ1NLP 모델은 영상의학 보고서에서 추적 검사 권고사항을 포함하는 문장을 얼마나 정확하게 식별할 수 있는가?
  • RQ2NLP 모델은 추적 검사 권고사항의 특정 구성 요소—이유, 검사 유형, 시간 프레임—을 얼마나 잘 추출하는가?
  • RQ3대규모 영상의학 데이터셋에서 추적 검사 권고사항은 얼마나 퍼진 편이며, 이행 패턴은 어떠한가?
  • RQ4영상의학 보고서의 임상적 권고사항은 확립된 추적 검사 지침과 얼마나 일치하는가?
  • RQ5자동으로 추적 검사 권고사항을 추출하는 것은 품질 향상 및 환자 안전 프로그램을 지원하는 데 기여할 수 있는가?

주요 결과

  • 모델은 추천 문장을 식별하는 데 F-점수 0.92를 기록하여 임상적으로 관련성이 높은 권고사항을 탐지하는 데 뛰어난 성능을 보였다.
  • 추적 검사 권고사항의 시간 프레임을 추출하는 데 F-점수 0.84를 기록하여 시간 정보 추출의 높은 정확도를 입증했다.
  • 검사 유형 추출의 F-점수는 0.73로, 추천된 영상 촬영 방식이나 절차를 식별하는 데 탄탄한 성능을 보였다.
  • 가장 낮은 F-점수는 이유 추출에 대해 0.65였으며, 임상적 정당화 근거를 식별하는 데 향후 개선이 필요함을 시사했다.
  • 330만 건의 보고서에 대한 적용을 통해 대규모 추적 검사 이행도 분석이 가능해졌으며, 임상 워크플로우 패턴과 치료의 격차를 드러내는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.