Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Spelling Correction for Clinical Text Mining in Russian

Ksenia Balabaeva, Anastasia A. Funkner|arXiv (Cornell University)|2020. 04. 10.
Natural Language Processing Techniques인용 수 9
한 줄 요약

이 논문은 문자 거리 알고리즘과 기계 학습 임beddings를 조합한 러시아어 임상 텍스트 마이닝을 위한 하이브리드 철자 검사기를 제시한다. 이는 총 정밀도 86%, 어휘 정밀도 97.5%, 오류 정밀도 74%를 달성하였다. 이 시스템은 철자 오류, 否정, 경험자, 시간적 특성 탐지 문제를 해결하기 위해 보다 광범위한 의료 텍스트 마이닝 파이프라인에 통합되었다.

ABSTRACT

The main goal of this paper is to develop a spell checker module for clinical text in Russian. The described approach combines string distance measure algorithms with technics of machine learning embedding methods. Our overall precision is 0.86, lexical precision - 0.975 and error precision is 0.74. We develop spell checker as a part of medical text mining tool regarding the problems of misspelling, negation, experiencer and temporality detection.

연구 동기 및 목표

  • 러시아어 임상 텍스트에서 철자 오류가 흔하고 후속 분석에 영향을 미치는 데 맞춰 특화된 강력한 철자 검사기를 개발하기 위해.
  • 철자 교정을 종합적인 의료 텍스트 마이닝 파이프라인에 통합하여 핵심 임상 NLP 작업을 해결하기 위해.
  • 러시아어 전자 건강 기록에서의 철자 오류를 교정함으로써 임상 정보 추출 정확도를 향상시키기 위해.
  • 저자원 임상 NLP 환경에서 기존 문자 거리 측정법과 학습된 임beddings를 조합한 하이브리드 접근 방식의 성능을 평가하기 위해.
  • 러시아어의 특수 과제, 예를 들어 풍부한 표면 변화와 임상 노트에서 흔한 철자 발음 오류를 해결하기 위해.

제안 방법

  • 철자 오류가 발생한 단어의 후보 교정을 식별하기 위해 문자 거리 측정법(예: 레벤슈타인, 자로-윈클러)을 사용한다.
  • 임상 텍스트에서 학습된 단어 임beddings를 사용하여 의미적 및 문법적 유사성 기반으로 교정을 우선순위 정렬한다.
  • 거리 기반 후보와 임beddings 기반 점수의 출력을 조합하여 교정을 순위 매기는 하이브리드 모델을 구성한다.
  • 수동으로 표기된 철자 오류가 포함된 실제 러시아어 임상 노트의 정제된 데이터셋을 기반으로 시스템을 학습하고 평가한다.
  • 임상 서술문에서 否정, 경험자, 시간적 특성 탐지를 위한 더 큰 텍스트 마이닝 프레임워크에 파이프라인을 통합한다.
  • 평가 지표로 총 정밀도, 어휘 정밀도(정확한 단어 교체에 대한), 오류 정밀도(정확히 식별된 오류에 대한)를 포함한다.

실험 결과

연구 질문

  • RQ1러시아어 임상 텍스트에서 문자 거리와 단어 임beddings를 조합한 하이브리드 접근 방식은 철자 교정에 얼마나 효과적인가?
  • RQ2실세계 러시아어 임상 노트에서 이 철자 검사기의 정밀도와 재현율 측면에서 성능은 어떠한가?
  • RQ3철자 교정의 통합이 否정 및 시간적 특성 탐지와 같은 후속 임상 텍스트 마이닝 작업에 어떻게 기여하는가?
  • RQ4임beddings 기반 방법이 문자 거리 기반 방법에 비해 교정 정확도를 얼마나 향상시키는가?
  • RQ5도메인 특화 학습 데이터가 모델이 의료 용어와 철자 발음 오류를 교정하는 능력에 미치는 영향은 어떠한가?

주요 결과

  • 시스템은 총 정밀도 86%를 달성하여, 교정 제안의 86%가 정확했음을 나타낸다.
  • 어휘 정밀도는 97.5%에 도달하여, 철자 오류가 있는 단어를 정확한 대체어로 교체하는 데 높은 정확도를 보였다.
  • 오류 정밀도는 74%였으며, 이는 테스트 세트의 실제 철자 오류 중 74%가 정확히 오류로 식별되었음을 의미한다.
  • 단어 임beddings의 통합은 문자 거리 기반 방법에 비해 교정 품질을 크게 향상시켰으며, 특히 동음이이이나 형태소적으로 복잡한 단어에서 두드러졌다.
  • 의료 상태와 약물 이름처럼 러시아어 임상 노트에서 흔한 도메인 특화 용어에 대해 뛰어난 성능을 보였다.
  • 임상 텍스트의 노이즈를 줄임으로써 시스템은 정보 추출 파이프라인의 신뢰성을 향상시키는 데 효과적으로 후속 NLP 작업을 지원하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.