Skip to main content
QUICK REVIEW

[논문 리뷰] IAM at CLEF eHealth 2018: Concept Annotation and Coding in French Death Certificates

Sébastien Cossin, Vianney Jouhet|arXiv (Cornell University)|2018. 07. 10.
Biomedical Text Mining and Ontologies인용 수 5
한 줄 요약

이 논문은 표준어 일치, 레벤슈타인 거리로 오타 수정, 약어 처리를 통한 프랑스어 사망증명서의 ICD-10 코드화를 위한 사전 기반 접근법을 제시한다. 시스템은 CLEF eHealth 2018 챌린지의 평균 참가자보다 뛰어난 성능을 보이며 F-점수 0.786(정밀도: 0.794, 재현율: 0.779)를 달성하였다.

ABSTRACT

In this paper, we describe the approach and results for our participation in the task 1 (multilingual information extraction) of the CLEF eHealth 2018 challenge. We addressed the task of automatically assigning ICD-10 codes to French death certificates. We used a dictionary-based approach using materials provided by the task organizers. The terms of the ICD-10 terminology were normalized, tokenized and stored in a tree data structure. The Levenshtein distance was used to detect typos. Frequent abbreviations were detected by manually creating a small set of them. Our system achieved an F-score of 0.786 (precision: 0.794, recall: 0.779). These scores were substantially higher than the average score of the systems that participated in the challenge.

연구 동기 및 목표

  • 규칙 기반 시스템을 사용하여 프랑스어 사망증명서에 자동으로 ICD-10 코드를 할당하는 것.
  • 의사가 입력한 텍스트에서 철자 변형과 약어가 존재하더라도 의학 용어를 인식하는 것을 향상시키는 것.
  • 일반 목적의 의미 주석 도구의 공통 생물의학 NLP 챌린지에서의 성능을 평가하는 것.
  • 외부 ICD-10 용어를 포함할 경우 시스템의 재현율과 정밀도에 어떤 영향을 미치는지 조사하는 것.
  • 독립된 형용사나 복합어와 같은 용어 검출의 한계를 특정하는 것.

제안 방법

  • 학습 세트의 인간 코드화된 용어에서 사전을 하나 구축하고(런 2), 2015년 ICD-10 용어를 추가하여 두 번째 사전을 구성함(런 1).
  • 음절 기호 제거, 구두점 제거, 소문자 변환, 불용어어 제거를 통해 용어를 정규화함.
  • 용어를 토큰화하고 각 루트에서 리프까지의 경로가 N-그램 용어를 나타내는 트리 데이터 구조에 저장함.
  • 각 토큰에 대해 세 가지 일치 기법을 사용: 완벽 일치, 약어 일치(수동으로 정렬된 목록에서), 오타 탐지용 레벤슈타인 거리.
  • Lucene™을 활용하여 효율적인 문자열 일치를 수행함. 이 과정에서 유니그램 및 바이그램 색인을 사용하여 복합어 해결.
  • 각 단계에서 가장 긴 인식된 용어를 선택하고, 유효한 계속 경로가 없을 경우 트리의 루트에서 다시 검색을 시작함.

실험 결과

연구 질문

  • RQ1오타 수정 및 약어 처리 기능을 갖춘 사전 기반 시스템이 의사가 작성한 사망증명서 텍스트를 ICD-10 코드로 효과적으로 매핑할 수 있는가?
  • RQ2외부 ICD-10 용어를 포함할 경우 코드화의 재현율과 정밀도에 어떤 영향을 미치는가?
  • RQ3독립된 형용사가 용어 인식에 어떤 영향을 미치며, 이를 어떻게 완화할 수 있는가?
  • RQ4일반 목적의 주석 도구의 성능은 공통 벤치마크에서 전문 시스템과 비교해 어떻게 되는가?
  • RQ5레벤슈타인 거리와 N-그램 색인화가 어휘 변형의 인식을 얼마나 향상시킬 수 있는가?

주요 결과

  • 런 2에서는 학습 세트의 인간 코드화된 용어만을 사용하여 F-점수 0.786(정밀도: 0.794, 재현율: 0.779)를 기록함.
  • 런 1은 2015년 ICD-10 용어를 포함하고 있었지만, 약간 낮은 재현율(0.772)과 F-점수(0.777)를 보여, 추가 용어가 성능 향상에 기여하지 않았음을 시사함.
  • 평균 참가자(F-점수 0.634)와 중앙 참가자(F-점수 0.641)보다 뛰어난 성능을 보였음.
  • 주요 한계로는 형용사가 분리되어 있을 경우, 예를 들어 'metastase hepatique et renale'에서 'renale'이 인식되지 않는 경우가 있었음.
  • 자주 사용되는 약어를 수동으로 포함시켜 재현율을 향상시켰지만, 이 과정의 자동화로 성능 향상이 가능할 것으로 기대됨.
  • 후처리 필터링 및 기계 학습 기법 통합은 정밀도 향상과 관련 없는 코드 처리를 위해 향후 개선 방향으로 고려될 수 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.