Skip to main content
QUICK REVIEW

[논문 리뷰] NUBES: A Corpus of Negation and Uncertainty in Spanish Clinical Texts

Salvador Lima, Naiara Pérez|arXiv (Cornell University)|2020. 04. 02.
Natural Language Processing Techniques참고 문헌 23인용 수 10
한 줄 요약

NUBes는 부정 및 불확실성에 대해 주석 처리된 대규모로 공개된 스페인어 임상 텍스트 코퍼스로, 29,682개의 문장에 대해 촉진자, 범위, 사건 및 극성의 세밀한 레이블링을 포함한다. 이는 스페인어에서 체계적으로 전망(annotation)을 포함한 첫 번째 코퍼스이며, 딥러닝 실험을 통해 검증되어 생물의학 분야의 NLP에 새로운 벤치마크를 설정했다.

ABSTRACT

This paper introduces the first version of the NUBes corpus (Negation and Uncertainty annotations in Biomedical texts in Spanish). The corpus is part of an on-going research and currently consists of 29,682 sentences obtained from anonymised health records annotated with negation and uncertainty. The article includes an exhaustive comparison with similar corpora in Spanish, and presents the main annotation and design decisions. Additionally, we perform preliminary experiments using deep learning algorithms to validate the annotated dataset. As far as we know, NUBes is the largest publicly available corpus for negation in Spanish and the first that also incorporates the annotation of speculation cues, scopes, and events.

연구 동기 및 목표

  • 스페인어 임상 텍스트에서의 부정 및 불확실성에 대해 종합적이고 공개 가능한 코퍼스의 부족을 해결하기 위해.
  • 생물의학적 스페인어에서의 부정 및 전망에 대한 표준화된 주석 프레임워크를 개발하여, 촉진자, 범위, 사건 및 극성 수정자를 포함한다.
  • 딥러닝 및 시퀀스 레이블링 작업을 지원하는 대규모 고품질 데이터셋을 구축하기 위해.
  • 신경망 기반 시퀀스 레이블링 모델을 사용한 예비 실험을 통해 코퍼스를 검증하기 위해.
  • 스페인어에서 사실성, 불확실성 및 임상 추론 분야의 향후 연구를 위한 기반을 마련하기 위해.

제안 방법

  • 의료 기록에서 유출된 29,682개의 익명화된 임상 문장을, 세밀한 다단계 주석 체계를 사용하여 부정 및 불확실성 요소로 주석 처리하기 위해.
  • 네 가지 핵심 구성 요소를 정의하고 레이블링하기: 부정/불확실성 촉진자, 그들의 의미적 범위, 대상 사건, 극성 수정자.
  • 다수의 주석자 간 일관된 주석 가이드라인 적용 및 모호한 사례에 대해 의료 전문가의 자문을 거치기 위해.
  • IULA-SCRC 코퍼스를 확장하여 IULA+로 전환하고, 동일한 가이드라인을 사용해 불확실성 주석을 추가하기 위해.
  • NUBes 데이터셋을 기반으로 딥러닝 모델(CRF, BERT 기반 시퀀스 레이블링 등)을 훈련 및 평가하여 기준 성능을 확립하기 위해.
  • 코퍼스, 가이드라인 및 코드를 GitHub를 통해 공개하여 재현 가능성과 공동체 활용을 지원하기 위해.

실험 결과

연구 질문

  • RQ1어떻게 스페인어 임상 텍스트에서 고해상도 및 일관성 있는 부정 및 불확실성을 체계적으로 주석 처리할 수 있는가?
  • RQ2기존의 스페인어 코퍼스와 비교할 때 NUBes의 상대적 규모 및 커버리지 범위는 어떠한가?
  • RQ3딥러닝 모델이 NUBes 코퍼스를 사용하여 시퀀스 레이블링 작업에서 얼마나 신뢰할 수 있는 성능을 달성할 수 있는가?
  • RQ4의료 언어에서 의미가 모호하거나 맥락에 따라 달라지는 표현들, 예를 들어 'sin clara' 또는 'dar la impresión de' 같은 표현들은 주석 가이드라인에서 어떻게 다루어지는가?
  • RQ5임상 언어에서 부정과 불확실성을 구분하는 데 발생하는 과제들은 무엇이며, 이를 어떻게 해결할 수 있는가?

주요 결과

  • NUBes는 스페인어 임상 텍스트에서 부정에 대해 가장 큰 공개 코퍼스로, 주석 처리된 문장이 총 29,682개이다.
  • 이 코퍼스는 스페인어 생물의학 텍스트에서 전망 촉진자, 범위 및 사건에 대해 처음으로 체계적으로 주석 처리된 사례를 포함한다.
  • NUBes의 문장 중 25.49%는 부정을 포함하고 있으며, 7.48%는 불확실성을 포함하고 있어 상당한 언어학적 복잡성을 반영한다.
  • 딥러닝 모델을 사용한 예비 실험 결과, 코퍼스는 시퀀스 레이블링 작업에서 경쟁 가능한 기준 성능을 지원하는 것으로 나타났다.
  • 주석 과정은 'sin clara'를 단일 불확실성 촉진자로 간주하고, 'dar la impresión de'를 전망 마커로 인식함으로써 모호한 사례를 성공적으로 해결했다.
  • 코퍼스 및 가이드라인은 공개되어 있어 재현 가능하며, 향후 연구 공동체의 확장과 활용을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.