Skip to main content
QUICK REVIEW

[논문 리뷰] Clinical Text Summarization with Syntax-Based Negation and Semantic Concept Identification

Wei‐Hung Weng, Yu-An Chung|arXiv (Cornell University)|2020. 02. 29.
Topic Modeling참고 문헌 31인용 수 8
한 줄 요약

이 논문은 UMLS를 사용한 의미적 개념 식별과 구성 트리 파싱을 통합하여 높은 정밀도로 부정된 임상 개념을 탐지하는 문법 기반 임상 텍스트 요약 방법을 제안한다. 언어적 구조와 전문가가 정제한 생물의학 지식을 활용하여, 특히 복잡하거나 파편화된 서술형 노트에서 핵심 임상 개념의 부정 여부를 임상적으로 수용 가능한 성능으로 식별한다.

ABSTRACT

In the era of clinical information explosion, a good strategy for clinical text summarization is helpful to improve the clinical workflow. The ideal summarization strategy can preserve important information in the informative but less organized, ill-structured clinical narrative texts. Instead of using pure statistical learning approaches, which are difficult to interpret and explain, we utilized knowledge of computational linguistics with human experts-curated biomedical knowledge base to achieve the interpretable and meaningful clinical text summarization. Our research objective is to use the biomedical ontology with semantic information, and take the advantage from the language hierarchical structure, the constituency tree, in order to identify the correct clinical concepts and the corresponding negation information, which is critical for summarizing clinical concepts from narrative text. We achieved the clinically acceptable performance for both negation detection and concept identification, and the clinical concepts with common negated patterns can be identified and negated by the proposed method.

연구 동기 및 목표

  • 전자 건강 기록(EHR) 내 비정형적이거나 불완전한 서술형 임상 텍스트를 요약하여 임상 의사결정 지원에 기여하는 데 도전한다.
  • 순수한 통계적 및 딥러닝 모델의 한계를 극복하기 위해 해석 가능한 언어학적 및 생물의학 지식을 통합한다.
  • 구문 분석 및 의미 필터링을 통해 임상적으로 관련된 개념과 그 부정 상태의 정확도를 향상시킨다.
  • 규칙 기반 시스템을 개발하여 부정 트리거를 분류하고, 이를 구문 구조에 적용하여 잘못된 임상 개념을 정확히 식별한다.
  • 부정 상태를 포함한 핵심 임상 발견의 정제된 항목별 요약을 생성하여 효과적인 임상 소통을 위한 프로토타입을 구축한다.

제안 방법

  • 문장 분할, 토큰화, 임상 명명 엔터티 인식(ner)을 위해 Stanford CoreNLP과 Apache cTAKES를 활용하였다.
  • Stanford Tregex/Tsurgeon과 OpenNLP를 통해 구성 트리 파싱을 적용하여 부정 탐지에 적합한 구문적 구조를 추출하였다.
  • 예: 'no', 'rule out' 등의 부정 트리거를 유형별로 분류하고, 구문 규칙을 적용하여 부정의 범위를 결정하였다.
  • UMLS 메타테사우루스와 의미 네트워크를 통합하여 임상 개념을 정규화하고 노이즈를 줄였다. 이는 거짓 양성 결과를 감소시켰다.
  • 부정 탐지와 개념 식별을 통합하여 문서 섹션별로 구조화되고 항목화된 임상 발견 요약을 생성하였다.
  • 파편화되거나 약어로 된 임상 문장에서의 파싱 및 규칙 설계 개선을 위해 인간 전문가의 애너테이션을 활용하여 오류 분석을 수행하였다.

실험 결과

연구 질문

  • RQ1문법 기반 파싱은 비정형 서술형 EHR 노트에서 부정된 임상 개념 탐지에 어떻게 기여하는가?
  • RQ2UMLS를 통한 의미 필터링은 EHR 텍스트 내 임상 개념 식별의 정밀도를 얼마나 향상시키는가?
  • RQ3파편화되거나 약어로 된 문장이 포함된 임상 텍스트에 적용했을 때, 통계적 구성 파서의 한계는 무엇인가?
  • RQ4규칙 기반 부정 탐지와 언어적 구조를 조합한 방법이 자원이 제한된 임상 NLP 환경에서 엔드 투 엔드 딥러닝 모델보다 우수한 성능을 낼 수 있는가?
  • RQ5생물의학 지식 기반 자료를 구문 분석과 효과적으로 통합하여 해석 가능하고 임상적으로 의미 있는 요약을 생성할 수 있는가?

주요 결과

  • UMLS 의미 필터링을 사용할 경우 개념 식별의 F1 스코어는 0.836을 기록했고, 필터링 없이 사용할 경우 0.568이었으며, 이는 정밀도 향상의 상당한 기여를 보여준다.
  • 개념 식별 정확도는 필터링 없이 0.397에서 필터링을 적용한 후 0.719로 향상되었으며, 이는 의미 필터링이 관련 없는 또는 노이즈가 많은 개념을 효과적으로 제거함을 시사한다.
  • 일반적인 부정 패턴에 대해서는 부정 탐지가 효과적이었지만, 파편화되거나 약어로 된 임상 문장에서는 구성 트리의 파싱 오류로 인해 어려움을 겪었다.
  • UMLS 의미 필터링을 통해 '규정 또는 법'이나 '유전자 또는 게놈'과 같은 비임상적 의미 유형을 제거하여 거짓 양성 결과를 감소시켰다.
  • 모든 필터링 조건에서 재현율(recall)이 0.830으로 높았지만, 필터링 없이 사용할 경우 정밀도가 상당히 낮아, 임상 개념 추출에서 의미 유형 필터링의 필수성을 강조한다.
  • cTAKES NER가 때때로 지나치게 세분화되거나 모호한 개념을 생성하는 경향이 있음을 발견하였으며(예: '혀의 상승' 대비 '상승'), 이는 범위 정규화 또는 개념 융합 전략이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.