Skip to main content
QUICK REVIEW

[논문 리뷰] Pathology Extraction from Chest X-Ray Radiology Reports: A Performance Study

Tahsin Mostafiz, Khalid Ashraf|arXiv (Cornell University)|2018. 12. 06.
Topic Modeling참고 문헌 11인용 수 4
한 줄 요약

이 연구는 흉부 X선 방사선 검사 보고서에서 병리학적 용어를 추출하기 위해 의료 전용 API(MTI, MOD)와 일반적인 NLU API(IBM NLU)를 평가하여 성능이 열등하다고 밝힌다. 연구는 작업 전용 방사선 검사 코퍼스에 맞춰 미세조정된 커스터마이징된 DNN 기반 명명된 실체 인식(NER) 모델을 제안하며, 일반 병리학 추출의 경우 F1 스코어 49.91%와 투명도 추출의 경우 82.53%를 기록하여 모든 다른 도구를 압도적으로 뛰어넘는 성능을 보이며, 사전 학습된 솔루션보다 도메인 특화 모델 훈련이 훨씬 우수함을 입증한다.

ABSTRACT

Extraction of relevant pathological terms from radiology reports is important for correct image label generation and disease population studies. In this letter, we compare the performance of some known application program interface (APIs) for the task of thoracic abnormality extraction from radiology reports. We explored several medical domain specific annotation tools like Medical Text Indexer(MTI) with Non-MEDLINE and Mesh On Demand(MOD) options and generic Natural Language Understanding (NLU) API provided by the IBM cloud. Our results show that although MTI and MOD are intended for extracting medical terms, their performance is worst compared to generic extraction API like IBM NLU. Finally, we trained a DNN-based Named Entity Recognition (NER) model to extract the key concept words from radiology reports. Our model outperforms the medical specific and generic API performance by a large margin. Our results demonstrate the inadequacy of generic APIs for pathology extraction task and establish the importance of domain specific model training for improved results. We hope that these results motivate the research community to release larger de-identified radiology reports corpus for building high accuracy machine learning models for the important task of pathology extraction.

연구 동기 및 목표

  • 흉부 X선 방사선 검사 보고서에서 병리학적 용어를 추출하기 위해 공개된 기존 API—의료 전용(MTI, MOD)과 일반적인(IBM NLU)—의 성능을 평가하는 것.
  • 특히 잘못된 양성 결과와 용어 오분류 경향을 보이는 현재 의료 애너테이션 도구의 한계를 규명하는 것.
  • 흉부 X선 보고서 데이터에 특화된 커스터마이징된 딥 네트워크 기반 명명된 실체 인식(NER) 모델을 개발하고 검증하여 병리학적 추출 정확도를 향상시키는 것.
  • 작업 전용 모델 훈련이 사전 구축된 API조차도 뛰어나다는 것을 입증하는 것, 즉 의료 텍스트를 위한 설계된 API조차도 그렇지 않은 것.
  • 고정밀도 기계 학습 모델을 위한 의료 NLP 작업을 가능하게 하기 위해 더 큰, 탈식별화된 방사선 검사 보고서 코퍼스의 공개를 촉구하는 것.

제안 방법

  • 연구는 공개된 인디애나 흉부 X선 방사선 검사 보고서 데이터셋을 기준 코퍼스로 사용한다.
  • 세 가지 기존 API를 평가한다: MTI의 Non-MEDLINE 및 Mesh On Demand(MOD) 옵션, 그리고 IBM의 일반 NLU API.
  • 단어 임bedding과 시퀀스 레이블링 기법을 사용하여 동일한 데이터셋에 대해 엔드 투 엔드로 훈련된 커스터마이징된 DNN 기반 NER 모델을 구축한다.
  • 모델은 방사선 검사 보고서의 핵심 발견 항목을 고려하여 훈련되며, 부정(예: 'no opacity') 처리 및 유사한 의료 용어 간 구분을 포함한다.
  • 평가 지표로는 정밀도, 재현도, F1 스코어를 사용하며, 수동 애너테이션 기반 참값을 기반으로 병리학 유형별(예: 투명도, 심장비대)로 계산된다.
  • 모델 행동을 점검하기 위해 정성적 분석을 수행한다. 예를 들어, 부정 감지 및 모호하거나 드문 용어 처리 능력을 평가한다.

실험 결과

연구 질문

  • RQ1의료 전용 애너테이션 도구(MTI, MOD)와 일반 NLU API(IBM NLU)는 흉부 X선 방사선 검사 보고서에서 병리학적 용어를 어떻게 추출하는가?
  • RQ2기존 의료 API가 방사선 검사 보고서에 적용되었을 때, 잘못된 양성 결과와 잘못된 용어 매핑의 실패 유형은 무엇인가?
  • RQ3작업 전용 방사선 검사 보고서 코퍼스에 맞춰 미세조정된 DNN 기반 NER 모델은 의료 전용 및 일반 API를 모두 뛰어넘을 수 있는가?
  • RQ4이 작업에 대해 도메인 특화 모델 훈련이 사전 구축된 솔루션보다 F1 스코어를 얼마나 향상시키는가?
  • RQ5커스터마이징된 NER 모델이 부정 또는 의미 유사성과 같은 임상적 맥락을 이해하는 데 있어 주요 정성적 이점은 무엇인가?

주요 결과

  • DNN 기반 NER 모델은 일반 병리학 추출의 경우 F1 스코어 49.91%를 기록하여 IBM NLU(26.47%)와 MTI with MOD(15.42%)를 크게 뛰어넘었다.
  • 투명도 추출의 경우 NER 모델은 82.53%의 F1 스코어를 기록했으며, IBM NLU는 12.61%에 그쳤고, MTI의 두 설정 모두 0.00%의 F1 스코어를 기록했다.
  • 심장비대의 경우 NER 모델은 정밀도 90.90%, 재현도 28.57%를 기록하여 IBM NLU(4.54% F1)와 MTI with Non-MEDLINE(10.30% F1)를 뛰어넘었지만, MTI with MOD는 더 높은 재현도(62.85%)를 기록했다.
  • MTI 도구의 Non-MEDLINE 및 MOD 옵션 모두 '투명도'를 완전히 추출하지 못해 정밀도와 재현도가 각각 0.00%로 실패했으며, 이는 특정 방사선학적 용어 처리에 심각한 한계가 있음을 시사한다.
  • NER 모델은 'no opacity'와 같은 부정된 용어를 성공적으로 감지하고 의미적으로 유사한 용어를 구분하는 데 성공했으며, 이는 일반 및 의료 전용 API가 일관되게 실패한 영역이다.
  • 연구는 기존 의료 API인 MTI와 MOD가 원본 보고서에 존재하지 않는 용어를 도입하는 경향이 있음을 드러내며, 이는 신뢰성에 심각한 영향을 미친다. 예를 들어 'CABG'가 'nitro compounds hydrogen-ion'으로 잘못 분류되는 경우가 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.